GPT‑Live‑1 : le modèle vocal full‑duplex d’OpenAI arrive dans l’API
Le 10 septembre 2026, OpenAI a annoncé la disponibilité de GPT‑Live‑1 dans son API, en le présentant comme « un modèle vocal full‑duplex pour les conversations en temps réel ». La fiche du modèle indique la prise en charge de l’audio et du texte en entrée comme en sortie, des connexions WebRTC, WebSocket et téléphonie/SIP, ainsi que des fonctions natives de transcription ASR, de keyword biasing et de détection explicite du tour de parole. Le prix annoncé est de 0,05 USD par minute de voix, facturé à la seconde, tandis que le raisonnement complexe est délégué à un modèle de backend (dont GPT‑6 Astra) ou au SDK Codex, avec des coûts séparés.
OpenAI fait état d’une latence de turn‑taking de 0,798 s, contre 1,41 s pour le précédent GPT‑Realtime‑2.1 (‑43 % selon l’entreprise), et publie des benchmarks autodéclarés : 97,3 % sur Conversational Dynamics, 80,1 % d’interactivité sur Full Duplex Bench, 87 % de réussite sur les appels d’outils et 38,1 % sur les tâches de récupération documentaire TauBanking. Tous ces chiffres proviennent cependant d’OpenAI seule ; à ce jour, aucune évaluation indépendante ne confirme ces performances.
L’annonce énumère 12 voix en temps réel (Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta, Cinder) et signale que l’endpoint `v1/live/sessions` est réservé aux formules payantes (Tier 1 au minimum), avec des limites de sessions simultanées allant de 25 à 500 selon le palier. Le knowledge cutoff est fixé au 31 juillet 2025. Les modalités prises en charge restent l’audio et le texte, en entrée et en sortie : ni images ni vidéo. Malgré la promesse de simplifier l’architecture vocale, le modèle n’inclut pas le raisonnement interne, confié à un modèle distinct facturé à part.
Les principales incertitudes demeurent : l’annonce officielle parle de 83,6 % de tâches accomplies sur Tau3 support — contre 45,7 % pour GPT‑Realtime‑2.1 — tandis qu’Unite.AI rapporte 86,2 % de Pass@1 sur « Tau3 Voice Intelligence » : on ignore s’il s’agit de deux métriques distinctes ou d’une divergence. L’amélioration de 30 % revendiquée par OpenAI sur Full Duplex Bench est rapportée de façon ambiguë — points de pourcentage ou variation relative, rien ne le précise. Manquent des données sur les performances multilingues, en particulier pour l’italien, et sur la sécurité de l’intégration téléphonique. Enfin, OpenAI ne publie pas le coût total réel d’une session, qui dépend du modèle de backend choisi : les 0,05 USD la minute ne couvrent que la couche vocale.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Lus avec WebFetch : l’annonce officielle sur le canal Announcements de l’OpenAI Developer Community et la fiche du modèle sur developers.openai.com. Les deux documents concordent sur la date, le prix (0,05 USD/min), les voix, les transports, les modalités, les restrictions de palier et le knowledge cutoff. La page openai.com/index/gpt-live-1/ renvoie un 403 et n’a pas pu être ouverte. Date (10 septembre 2026), prix, latence de 0,798 s et architecture par délégation confirmés par deux médias indépendants, Unite.AI et DigitalToday. Les chiffres Tau3 divergent selon les sources : ils figurent parmi les incertitudes, pas parmi les faits.
- Incertezze
- Les chiffres Tau3 ne collent pas : l’annonce officielle indique 83,6 % de tâches accomplies sur Tau3 support (contre 45,7 % pour GPT‑Realtime‑2.1), Unite.AI indique 86,2 % de Pass@1 sur « Tau3 Voice Intelligence » — deux métriques distinctes ou une divergence, impossible de trancher. Le +30 % sur Full Duplex Bench est ambigu : points de pourcentage ou variation relative. OpenAI ne publie pas le coût réel d’une session, qui dépend du modèle de backend. Aucune donnée sur les langues autres que l’anglais — l’italien compris — ni sur la sécurité de l’intégration téléphonique. Aucun benchmark n’a été reproduit à ce jour par un tiers indépendant.
- Perché pubblicarla
- C’est un changement d’architecture, pas une annonce marketing : le full‑duplex dans un seul modèle supprime la chaîne à trois étages sur laquelle repose aujourd’hui presque tout agent vocal, et le prix à la minute rend la comparaison économique vérifiable. Cela concerne directement celles et ceux qui, en Italie, construisent des assistants téléphoniques et du service client. Et une chose mérite d’être dite honnêtement : le prix affiché ne couvre que la voix, le raisonnement se paie à part, et les benchmarks, c’est OpenAI qui se les décerne.