Lo Último en Tecnología

Google lanza nuevas capacidades de transcripción con Gemini 3.5 Transcribe: Editando ‘ums’ y ‘ahs’ de forma automática

Fuente: ExploxTV

Google lanza nuevas capacidades de transcripción con Gemini 3.5 Transcribe: Editando ‘ums’ y ‘ahs’ de forma automática

Google ha actualizado Gemini Audio con nuevas capacidades de transcripción que permiten a los usuarios editar de forma natural su discurso, eliminando las interrupciones típicas como 'ums' y 'ahs'. Esta nueva funcionalidad, conocida como Gemini 3.5 Transcribe, se une a las actualizaciones de Gemini 3.5 Live y 3.5 Live Experimental, que mejoran la precisión de la transcripción y la capacidad de manejar interrupciones y ruido de fondo.

Contexto y Antecedentes

Google ha estado trabajando en la evolución de sus modelos de inteligencia artificial para mejorar la precisión y la fluidez en la transcripción de voz a texto. La nueva versión Gemini 3.5 Transcribe representa un paso significativo en esta dirección, ofreciendo una mayor precisión en la detección de jerga especializada y más de 85 idiomas.

Características de Gemini 3.5 Transcribe

Gemini 3.5 Transcribe es una adición completamente nueva a la familia Gemini, y su lanzamiento se produce en un momento en que Google aún espera la salida de Gemini 3.5 Pro, que estaba programada para junio. Según Google, esta nueva transcripción representa un avance significativo respecto a su modelo anterior, Chirp 3, especialmente en términos de rendimiento multilingüe y tasas de error en la redacción.

📌 Puntos Clave

  • Permite a los usuarios editar su discurso naturalmente con solo su voz.
  • Elimina automáticamente palabras interrupción como 'ums' y 'ahs'.
  • Permite la adición de vocabulario personalizado para adaptarse a jerga especializada y requisitos de ortografía únicos.
  • Identifica hasta tres hablantes en grabaciones pregrabadas y proporciona timestamps de palabra.

Gemini 3.5 Live y 3.5 Live Experimental

Gemini 3.5 Live y 3.5 Live Experimental se basan en la tecnología de reconocimiento de voz existente que impulsa el modo de chat de voz de Gemini. 3.5 Live es mejor en el manejo de interrupciones en mitad de la oración, la reconocimiento de idiomas y el procesamiento visual en tiempo real, mientras que 3.5 Live Experimental avanza aún más, narrando su progreso paso a paso en tiempo real mientras aborda tareas más complejas.

Lanzamiento y Disponibilidad

Estas actualizaciones de Gemini Audio se están implementando desde hoy en inglés para todos los usuarios de macOS Gemini y la funcionalidad de dictado Rambler en Android en varios países y lenguajes. También se encuentra en vista pública en la API Gemini a través de AI Studio y Antigravity, con soporte para Chrome en camino.

Conclusión

La introducción de Gemini 3.5 Transcribe marca un hito en la evolución de la transcripción automática, permitiendo a los usuarios editar su discurso naturalmente con solo su voz. Esta nueva funcionalidad no solo mejora la precisión de la transcripción, sino que también facilita la adición de vocabulario personalizado y la adaptación a jerga especializada. A medida que la inteligencia artificial continúa avanzando, expectativas se elevan para la calidad y la fluidez de la transcripción automática, y Gemini 3.5 Transcribe representa un paso significativo en esa dirección.

💡 La Opinión de ExploxTV

Esta actualización de Google muestra una vez más su compromiso con la mejora continua de la inteligencia artificial en la transcripción de voz a texto. Gemini 3.5 Transcribe no solo ofrece una mayor precisión, sino que también simplifica el proceso de edición para los usuarios. A medida que la tecnología avanza, expectativas se elevan para la calidad y la fluidez de la transcripción automática, y Gemini 3.5 Transcribe representa un paso significativo en esa dirección.