Gemini 3.5 Transcribe: el nuevo modelo de voz a texto de Google

  • Google presenta Gemini 3.5 Transcribe, su modelo de voz a texto más preciso hasta la fecha.
  • Ofrece transcripción inteligente que corrige autocorrecciones, elimina muletillas y formatea el texto automáticamente.
  • Soporta más de 85 idiomas, reconoce hasta tres hablantes y reduce el tiempo de transcripción un 70% frente a Chirp 3.
  • Ya disponible en Gboard, Gemini para macOS y para desarrolladores; su llegada a Chrome está prevista.

Gemini 3.5 Transcribe

Google ha presentado Gemini 3.5 Transcribe, su nuevo modelo de inteligencia artificial especializado en convertir voz en texto. La compañía lo describe como su sistema más preciso hasta la fecha, diseñado para interacciones de voz inteligentes. A diferencia de los sistemas tradicionales, este modelo no solo transcribe lo que se dice, sino que también interpreta la intención del hablante, corrige errores sobre la marcha y produce un texto limpio y formateado.

El modelo está pensado para usos tanto en tiempo real como en grabaciones, y promete funcionar bien en entornos ruidosos, con acentos o tecnicismos. Además, detecta automáticamente más de 85 idiomas, reconoce hasta tres interlocutores y añade marcas de tiempo palabra por palabra. Todo ello con una tasa de error notablemente baja, según las mediciones independientes.

Transcripción inteligente: más que un dictado

Gemini 3.5 Transcribe

Una de las claves de Gemini 3.5 Transcribe es su capacidad para entender las autocorrecciones. Por ejemplo, si el hablante dice «quedamos el martes… no, el miércoles», el modelo se queda con la segunda opción. También elimina muletillas como «eh» o «em» y aplica automáticamente puntuación y formato. Además, permite añadir vocabulario personalizado para reconocer nombres propios, términos técnicos o palabras poco comunes. Según los datos publicados por Google, la tasa de error por palabra es del 4% en streaming y del 2,6% en audio pregrabado, medido por Artificial Analysis.

Otra característica destacada es la velocidad. Frente a Chirp 3, su anterior modelo, Google asegura que el tiempo hasta obtener el texto final se reduce un 70%. En directo, la latencia es inferior a un segundo, lo que permite su uso en subtitulado en tiempo real o asistentes de voz.

Integración en el ecosistema de Google

Gemini 3.5 Transcribe

Gemini 3.5 Transcribe ya está integrado en varios productos de Google. En Android, la función Rambler de Gboard utiliza este modelo para la entrada de voz a texto. En la aplicación Gemini para macOS, también está disponible, permitiendo usar comandos de voz con contexto de pantalla para resumir archivos, generar imágenes o reutilizar texto. Además, Google Antigravity lo incorpora para combinar el contexto de pantalla y el historial de chat.

La compañía también ha anunciado que el modelo llegará próximamente a Chrome. Esto permitirá a los usuarios dictar texto en cualquier campo web, como correos electrónicos, formularios o publicaciones, sin necesidad de teclear. Aunque no hay fecha concreta, se espera que esta función amplíe el uso de la transcripción por voz en el navegador.

Disponibilidad para desarrolladores

Gemini 3.5 Transcribe

Para los desarrolladores, Gemini 3.5 Transcribe está disponible en vista previa pública a través de la API de Gemini, en Google AI Studio y en Gemini Enterprise Agent Platform. Se ofrecen dos modalidades: la Live API para streaming bidireccional en tiempo real, con latencia inferior a un segundo, y la Interactions API para procesar audio pregrabado, con atribución de hablante y marcas de tiempo. La primera está pensada para agentes de voz y subtitulado en vivo, mientras que la segunda es útil para reuniones, entrevistas o análisis de llamadas.

El modelo también puede delegar tareas complejas a otros modelos de Gemini, como la generación de imágenes o el análisis de archivos, mediante llamadas a funciones. Esta capacidad está disponible actualmente en la aplicación Gemini para macOS.

La apuesta de Google por la voz como interfaz principal se refuerza con Gemini 3.5 Transcribe. Su combinación de precisión, velocidad y funciones inteligentes lo convierten en una herramienta clave tanto para usuarios como para desarrolladores. Con la promesa de llegar a Chrome, el dictado por voz podría convertirse en algo cotidiano en la web. Queda por ver cómo se adapta a casos de uso más exigentes, pero los primeros datos son prometedores.


Añadir como fuente preferida en Google