
Google ha presentado Gemini 3.5 Transcribe, su nuevo modelo de inteligencia artificial especializado en convertir voz en texto. La compañÃa lo describe como su sistema más preciso hasta la fecha, diseñado para interacciones de voz inteligentes. A diferencia de los sistemas tradicionales, este modelo no solo transcribe lo que se dice, sino que también interpreta la intención del hablante, corrige errores sobre la marcha y produce un texto limpio y formateado.
El modelo está pensado para usos tanto en tiempo real como en grabaciones, y promete funcionar bien en entornos ruidosos, con acentos o tecnicismos. Además, detecta automáticamente más de 85 idiomas, reconoce hasta tres interlocutores y añade marcas de tiempo palabra por palabra. Todo ello con una tasa de error notablemente baja, según las mediciones independientes.
Transcripción inteligente: más que un dictado
Una de las claves de Gemini 3.5 Transcribe es su capacidad para entender las autocorrecciones. Por ejemplo, si el hablante dice «quedamos el martes… no, el miércoles», el modelo se queda con la segunda opción. También elimina muletillas como «eh» o «em» y aplica automáticamente puntuación y formato. Además, permite añadir vocabulario personalizado para reconocer nombres propios, términos técnicos o palabras poco comunes. Según los datos publicados por Google, la tasa de error por palabra es del 4% en streaming y del 2,6% en audio pregrabado, medido por Artificial Analysis.
Otra caracterÃstica destacada es la velocidad. Frente a Chirp 3, su anterior modelo, Google asegura que el tiempo hasta obtener el texto final se reduce un 70%. En directo, la latencia es inferior a un segundo, lo que permite su uso en subtitulado en tiempo real o asistentes de voz.
Integración en el ecosistema de Google
Gemini 3.5 Transcribe ya está integrado en varios productos de Google. En Android, la función Rambler de Gboard utiliza este modelo para la entrada de voz a texto. En la aplicación Gemini para macOS, también está disponible, permitiendo usar comandos de voz con contexto de pantalla para resumir archivos, generar imágenes o reutilizar texto. Además, Google Antigravity lo incorpora para combinar el contexto de pantalla y el historial de chat.
La compañÃa también ha anunciado que el modelo llegará próximamente a Chrome. Esto permitirá a los usuarios dictar texto en cualquier campo web, como correos electrónicos, formularios o publicaciones, sin necesidad de teclear. Aunque no hay fecha concreta, se espera que esta función amplÃe el uso de la transcripción por voz en el navegador.
Disponibilidad para desarrolladores
Para los desarrolladores, Gemini 3.5 Transcribe está disponible en vista previa pública a través de la API de Gemini, en Google AI Studio y en Gemini Enterprise Agent Platform. Se ofrecen dos modalidades: la Live API para streaming bidireccional en tiempo real, con latencia inferior a un segundo, y la Interactions API para procesar audio pregrabado, con atribución de hablante y marcas de tiempo. La primera está pensada para agentes de voz y subtitulado en vivo, mientras que la segunda es útil para reuniones, entrevistas o análisis de llamadas.
El modelo también puede delegar tareas complejas a otros modelos de Gemini, como la generación de imágenes o el análisis de archivos, mediante llamadas a funciones. Esta capacidad está disponible actualmente en la aplicación Gemini para macOS.
La apuesta de Google por la voz como interfaz principal se refuerza con Gemini 3.5 Transcribe. Su combinación de precisión, velocidad y funciones inteligentes lo convierten en una herramienta clave tanto para usuarios como para desarrolladores. Con la promesa de llegar a Chrome, el dictado por voz podrÃa convertirse en algo cotidiano en la web. Queda por ver cómo se adapta a casos de uso más exigentes, pero los primeros datos son prometedores.


