Gemini 3.5 Transcribe es la nueva apuesta de Google en el terreno del reconocimiento de voz, y no se trata solo de pasar audio a texto. El modelo interpreta lo que escucha, limpia el discurso y le da formato para entregar un resultado mucho más pulido. La gran diferencia respecto a lo que había hasta ahora está en que entiende las correcciones que hace el hablante mientras habla, elimina las muletillas y aplica la puntuación de forma automática, sin necesidad de una revisión posterior.
Los números que acompañan al anuncio son bastante llamativos. La tasa de error por palabra se sitúa en el 4% en streaming y baja hasta el 2,6% cuando se procesan archivos ya grabados. Google asegura además que el tiempo para obtener la transcripción final se reduce un 70% frente a Chirp 3, su motor anterior. Todo con soporte para más de 85 idiomas, detección de acentos regionales y capacidad para distinguir hasta tres interlocutores en una misma grabación.
Una transcripción que entiende la intención
Lo interesante es que Gemini 3.5 Transcribe no se limita a copiar palabra por palabra. Si alguien dice «programémoslo para el martes, no, miércoles», el modelo capta que la intención real es el miércoles y descarta la primera opción. Los típicos «eh» o «em» desaparecen del texto final, que sale ya con formato y puntuación.
El modelo admite un vocabulario personalizado de hasta mil términos, algo que ayuda mucho con nombres propios, siglas y jerga técnica. En sitios ruidosos la precisión se mantiene gracias a un entrenamiento con audio real, y los datos como códigos postales o números de pedido se capturan con fiabilidad. Para audio pregrabado, la atribución de hablantes funciona con hasta tres voces, aunque más allá de ese número la cosa todavía es experimental.
De Gboard a Chrome, con dos vías para desarrolladores
Google ya está desplegando el modelo en varios de sus productos. En Android, la función Rambler de Gboard lo usa para el dictado por voz y está disponible en los Pixel 11 con Gemini Intelligence. La aplicación Gemini para macOS también lo incorpora en inglés, combinando comandos de voz con lo que aparece en pantalla. Y la llegada a Chrome, todavía sin fecha concreta, permitiría dictar correos o rellenar formularios sin teclear.
Para quien programa, hay dos modalidades. La Live API ofrece streaming continuo con latencia por debajo del segundo, pensada para subtitulado en directo y bots de atención al cliente, con un límite de diez minutos por sesión. La Interactions API procesa archivos grabados y devuelve la transcripción completa con marcas de tiempo, admitiendo grabaciones de hasta una hora. En cuanto al coste, Google calcula unos 0,008 euros por minuto en directo y 0,005 euros por minuto para los archivos, cifras solo orientativas. La vista previa pública ya está disponible a través de la API de Gemini en Google AI Studio, y el soporte para español está confirmado dentro de esos 85 idiomas.
Fuente
Imagen: androidayuda.com
