GPT-Live llega a ChatGPT: la voz que sabe cuándo hablar y cuándo callar

OpenAI presenta GPT-Live, la voz de ChatGPT con arquitectura full-duplex que escucha, pausa y responde de forma más natural.

by Redazione
GPT-Live llega a ChatGPT: la voz que sabe cuándo hablar y cuándo callar - GPT-Live ChatGPT

GPT-Live es el nombre con el que OpenAI ha decidido rebautizar una nueva etapa del modo de voz de ChatGPT, y la presentación empezó con un gesto tan simple como revelador. Greg Brockman se puso a hablar con el asistente y lo interrumpió mientras respondía. No importaban tanto las preguntas cuanto la reacción del sistema. En vez de cortarse en seco, como pasaba antes, la voz ajustó la interrupción de una forma bastante más natural. Una demo cortísima, sí, pero suficiente para dejar clara la promesa: que el modo de voz de ChatGPT no solo suene mejor, sino que entienda cuándo hablar, cuándo esperar y cuándo quedarse callado.

Aquí no estamos ante una simple capa de sonido más pulida. Se trata de una familia de modelos pensada para procesar la conversación de otra manera. La clave está en una arquitectura llamada full-duplex, que permite a la inteligencia artificial escuchar mientras genera la respuesta. Según la compañía, esto reduce esa rigidez de los turnos que hacía sentir todo como una lista de órdenes.

La voz de ChatGPT ya no trabaja por turnos separados

Para captar el cambio conviene mirar atrás. El primer modo de voz funcionaba en cascada, con un modelo que transcribía, otro que respondía y un tercero que devolvía el audio. El modo avanzado unificó todo eso en un único modelo, pero seguía yendo por turnos. GPT-Live rompe con esa lógica y apuesta por una interacción continua, capaz de decidir varias veces por segundo si toca hablar, escuchar, pausar o echar mano de una herramienta.

¿Y qué se podrá hacer en la práctica? La empresa que dirige Sam Altman pone varios ejemplos. Interrumpir con una duda, parar un momento para pensar o pedirle que hable más despacio. La voz incluso suelta pequeñas señales como “mmm” o “sí” para indicar que sigue atenta, y aseguran que ahora se concentra mejor en el usuario cuando hay ruido de fondo. A esto se suman las nueve voces de ChatGPT remasterizadas, respuestas visuales en forma de tarjetas para el tiempo, deportes o bolsa, más soporte para búsqueda, memoria, imágenes y subida de archivos.

Link affiliato

Delegación en modelos frontera y despliegue global

Cuando la charla pide algo más que una respuesta rápida, GPT-Live puede delegar búsquedas web o razonamiento complejo en sus modelos frontera sin cortar la conversación. En el lanzamiento esa capa de apoyo será GPT-5.5, aunque irá cambiando con las próximas generaciones. También habrá niveles de razonamiento a elegir: Instant para lo rápido, Medium o High cuando toque pensar más.

OpenAI dice que en sus evaluaciones internas GPT-Live-1 y GPT-Live-1 mini superan al modo avanzado en fluidez, interrupciones y sensación de naturalidad en charlas de cinco a diez minutos. Son datos propios, eso sí, y habrá que ver cómo funcionan fuera del laboratorio. El despliegue arranca hoy en iOS, Android y ChatGPT.com, con GPT-Live-1 por defecto para Go, Plus y Pro, y GPT-Live-1 mini en las cuentas gratuitas. La API llegará más adelante, sin fecha. Por ahora no admite voz con vídeo ni pantalla compartida, aunque prometen añadirlo en el futuro.

Fuente
Imagen: xataka.com

Related Articles