GPT‑Live‑1: el modelo de voz full‑duplex de OpenAI llega a la API
El 10 de septiembre de 2026 OpenAI anunció la disponibilidad de GPT‑Live‑1 en su API y lo presentó como “un modelo de voz full‑duplex para conversaciones en tiempo real”. La ficha del modelo indica soporte de audio y texto tanto de entrada como de salida, conexiones WebRTC, WebSocket y telefonía/SIP, además de transcripción ASR nativa, keyword biasing y detección explícita del turno. El precio declarado es de 0,05 USD por minuto de voz, facturado al segundo, mientras que el razonamiento complejo se delega a un modelo de backend (entre ellos GPT‑6 Astra) o al SDK Codex, con costes aparte.
OpenAI declara una latencia de turn‑taking de 0,798 s frente a los 1,41 s del anterior GPT‑Realtime‑2.1 (‑43 % según la compañía) y publica benchmarks autodeclarados: 97,3 % en Conversational Dynamics, 80,1 % de interactividad en Full Duplex Bench, 87 % de éxito en las llamadas a herramientas y 38,1 % en las tareas de recuperación documental de TauBanking. Ahora bien, todas esas cifras las aporta únicamente OpenAI; por el momento no existe ninguna evaluación independiente que confirme el rendimiento.
El anuncio enumera 12 voces en tiempo real (Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta, Cinder) y señala que el endpoint `v1/live/sessions` está reservado a los planes de pago (Tier 1 como mínimo), con límites de sesiones concurrentes de 25 a 500 según el tier. El knowledge cutoff está fijado en el 31 de julio de 2025. Las modalidades admitidas siguen siendo audio y texto, de entrada y de salida: ni imágenes ni vídeo. Pese a la promesa de simplificar la arquitectura de voz, el modelo no incluye el razonamiento interno, que sigue en manos de un modelo aparte facturado por separado.
Las principales incógnitas siguen ahí: el anuncio oficial habla de un 83,6 % de tareas completadas en Tau3 support —frente al 45,7 % de GPT‑Realtime‑2.1—, mientras que Unite.AI informa de un 86,2 % de Pass@1 en “Tau3 Voice Intelligence”: no está claro si son dos métricas distintas o una discrepancia. La mejora del 30 % que OpenAI reivindica en Full Duplex Bench se reporta de forma ambigua: no se dice si son puntos porcentuales o variación relativa. Faltan datos sobre rendimiento multilingüe, sobre todo en italiano, y sobre la seguridad de la integración telefónica. Además, OpenAI no publica el coste total real de una sesión, que depende del modelo de backend elegido: los 0,05 USD por minuto cubren solo la capa de voz.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Leídos con WebFetch el anuncio oficial en el canal Announcements de la OpenAI Developer Community y la ficha del modelo en developers.openai.com: ambos documentos coinciden en fecha, precio (0,05 USD/min), voces, transportes, modalidades, restricciones de tier y knowledge cutoff. La página openai.com/index/gpt-live-1/ responde 403 y no se pudo abrir. Fecha (10 de septiembre de 2026), precio, latencia de 0,798 s y arquitectura de delegación confirmadas por dos medios independientes, Unite.AI y DigitalToday. Las cifras de Tau3 divergen entre fuentes: van entre las incertidumbres, no entre los hechos.
- Incertezze
- Las cifras de Tau3 no cuadran: el anuncio oficial dice 83,6 % de tareas completadas en Tau3 support (frente al 45,7 % de GPT‑Realtime‑2.1) y Unite.AI dice 86,2 % de Pass@1 en “Tau3 Voice Intelligence” — dos métricas distintas o una discrepancia, no hay manera de saberlo. El +30 % en Full Duplex Bench es ambiguo: puntos porcentuales o variación relativa. OpenAI no publica el coste real de una sesión, que depende del modelo de backend. Ningún dato sobre lenguas distintas del inglés —el italiano incluido— ni sobre la seguridad de la integración telefónica. Hasta ahora ningún benchmark ha sido replicado por terceros independientes.
- Perché pubblicarla
- Es un cambio de arquitectura, no un anuncio de marketing: el full‑duplex en un solo modelo elimina la cadena de tres etapas sobre la que hoy se sostiene casi cualquier agente de voz, y el precio por minuto hace verificable la comparación económica. Interesa directamente a quien en Italia construye asistentes telefónicos y atención al cliente. Y hay algo que conviene decir con honestidad: el precio publicitado cubre solo la voz, el razonamiento se paga aparte y los benchmarks se los pone OpenAI a sí misma.