Ubuntu 26.10 prueba Myna, el dictado por voz con IA sin conexión

by Tecnoandroid
Ubuntu 26.10 prueba Myna, el dictado por voz con IA sin conexión - Myna Ubuntu dictado voz

Canonical está experimentando en Ubuntu 26.10 una función que promete cambiar el modo de escribir en Linux. Se llama Myna y permite el dictado por voz con inteligencia artificial directamente en cualquier campo de texto activo, sin depender de Internet. La herramienta todavía está en desarrollo, pero ya es posible activar el reconocimiento de voz con un simple atajo de teclado. Y con el sistema entrando en la fase de congelación de funciones antes del lanzamiento, algunas piezas empiezan a mostrarse a la vista de todos.

Esta semana se ha sumado a las instalaciones por defecto de Ubuntu 26.10 una extensión de GNOME Shell que enseña un indicador en pantalla cuando Myna está escuchando y grabando audio. Conviene dejar clara una cosa. Myna no es esa extensión. Se trata de un orquestador que carga un modelo de inteligencia artificial, gestiona la activación por atajo, envía el audio del micrófono al modelo y devuelve la transcripción al campo de texto de la aplicación mediante IBus. La extensión es solo la punta del iceberg, la parte visible que avisa de que el sistema está procesando la voz.

Cómo funciona el dictado y qué aparece en pantalla

Para dictar con Myna basta con colocar el cursor donde se quiera escribir y pulsar Super + T. Aquí hay un cambio respecto a lo que Canonical había contado antes. Ya no hace falta mantener la combinación pulsada. Con un solo toque se activa la escucha. En pantalla surge un indicador con una onda animada que oscila mientras alguien habla, como confirmación visual de que el micrófono está captando audio.

Al pulsar de nuevo el mismo atajo, la escucha se detiene, la animación se aplana y el sistema transcribe el audio en segundo plano. Tras una breve pausa, el texto aparece en el campo elegido. En las pruebas realizadas, la entrada llegó correctamente a la mayoría de las aplicaciones, incluidos el editor de texto de Ubuntu, la vista general de GNOME Shell y el navegador Firefox, aunque con cierta lentitud, algo lógico en una versión de desarrollo ejecutada desde código fuente en una máquina virtual.

Link affiliato

Según la especificación de Myna, cerrar o minimizar la ventana de destino después de activar el dictado debería detener el proceso. Ese comportamiento, sin embargo, no siempre se ha reproducido de forma fiable. El indicador en pantalla sí ha avisado alguna vez de que se había perdido el foco de la ventana. Cambiar a otra con Alt+Tab, en cambio, no interrumpe el dictado. Myna recuerda cuál era el campo de texto original y evita que el resultado acabe pegado en el sitio equivocado. Y si no detecta ningún audio, también lo indica, porque no puede transcribir silencio.

Whisper, modelos locales y una función opcional

Canonical asegura que ningún audio sale del dispositivo. Myna no depende de modelos en la nube, funciona íntegramente offline y el audio usado para la transcripción no se almacena, no se registra ni se emplea para entrenar ningún modelo. En las pruebas actuales, la herramienta utiliza Whisper, pero el proyecto contempla ofrecer varios modelos locales distribuidos como snaps. Algunos pensados para ejecutarse solo con GPU NVIDIA, otros exclusivamente en CPU, con distinto soporte de idiomas según el caso.

Fuente
Imagen: softzone.es

Related Articles