Microsoft acaba de mover ficha con MAI-Transcribe-2, un modelo de transcripción de audio a texto que, según lo que ha ido saliendo a la luz, apuntaría a superar en precisión a los sistemas de OpenAI y Google. Y hay un detalle que llama la atención más que ningún otro, el precio que se le atribuye, unos 0,09 euros por cada hora de audio procesado, una cifra que lo colocaría entre las opciones más baratas del mercado para desarrolladores y empresas.
Conviene tomárselo con calma, eso sí. Ni el lanzamiento ni los números que circulan sobre MAI-Transcribe-2 han sido confirmados oficialmente por Microsoft, así que lo que sigue es lo que se sabe hasta ahora, con la prudencia que exige una información aún sin verificar de primera mano. El modelo se sumaría a la familia MAI, la línea de sistemas de inteligencia artificial que la división Microsoft AI, dirigida por Mustafa Suleyman, viene desarrollando en los últimos meses. A diferencia de lanzamientos anteriores de esa misma familia, más centrados en la generación de voz o en modelos de propósito general, este se dedicaría en exclusiva a convertir audio en texto. Una tarea nada menor, la usan a diario departamentos enteros para documentar reuniones, generar subtítulos o revisar llamadas de atención al cliente. No está claro si comparte arquitectura con MAI-Voice-1, el modelo de generación de voz que la misma división presentó hace unos meses, aunque los dos responderían a la misma idea de fondo, reducir la dependencia de proveedores externos de inteligencia artificial dentro de los propios servicios en la nube de Microsoft.
Qué mejora esta IA frente a OpenAI y Google
Microsoft sostendría que MAI-Transcribe-2 ofrece una precisión superior a la de los modelos de transcripción que venden OpenAI y Google, aunque no habría detallado en público qué pruebas o qué conjuntos de audio se habrían usado para llegar a esa conclusión. Se trataría, en todo caso, de una comparación planteada por la propia empresa y no de una validación independiente, algo bastante común cuando una tecnológica presenta un modelo propio frente a los de sus rivales directos.
El terreno de juego queda más claro que la cifra exacta de mejora. Hablamos de los servicios de voz a texto integrados en la nube, donde OpenAI ofrece su familia de modelos Whisper y sus derivados, y Google dispone de sus propias herramientas de Speech-to-Text dentro de Google Cloud. Las dos compañías cobran por el procesamiento de audio con esquemas de precios que cambian según el volumen y la calidad del modelo elegido, y sería justo en ese escenario donde Microsoft colocaría su nueva tarifa como reclamo frente al rendimiento que atribuye a su modelo.
Un precio que presiona las tarifas del sector
El coste de unos 0,09 euros por hora de audio procesado sería, si se confirma, uno de los argumentos centrales de este lanzamiento. Para una empresa que transcribe cientos de horas de grabaciones al mes, pensemos en reuniones internas, entrevistas o llamadas de soporte, la diferencia entre una tarifa ajustada y otra más cara puede notarse de forma directa en el presupuesto que destina a herramientas de inteligencia artificial.
Fuente
Imagen: softzone.es
