Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un modèle vocal temps réel est désormais proposé en API, facturé 0,05 $ par minute pour la couche voix. Yelp et Speak décrivent des gains sur la gestion d’appels et les interruptions, tandis que les développeurs obtiennent des leviers de personnalisation du style et des voix, y compris en téléphonie.
Disponible à 0,05 $ la minute, avec des gains rapportés par Yelp et Speak
GPT‑Live‑1 est accessible dans l’API au tarif de 0,05 $ par minute pour la couche vocale frontale. Alex Levy, CTO de Yelp, indique que l’intégration de GPT‑Live‑1 dans Yelp Host et Hatch a amélioré la prise de tours et la précision par rapport à l’architecture vocale précédente. Yelp rapporte des améliorations significatives des taux de gestion des appels lorsque Yelp Host traite des réservations et des commandes de nourriture avec ce modèle, et observe que les appelants formulent des phrases plus complètes et naturelles. Speak fait état d’une baisse des interruptions de près de 80 % face aux systèmes à tours de parole lors de premières évaluations. Andrew Hsu, co‑fondateur et CTO de Speak, affirme que le modèle apporte une naturalité de tutorat aux leçons en direct. Le modèle peut être associé à un agent et à un modèle d’arrière‑plan adaptés au produit, pour bâtir des expériences vocales évolutives selon les tâches.
Téléphonie en duplex intégral pour réservations et support
Le modèle autorise la mise en place d’agents vocaux capables d’opérer en duplex intégral lors d’appels téléphoniques, pour des tâches telles que la gestion de réservations ou l’assistance client. Chez Yelp, l’intégration dans Yelp Host pour traiter les appels liés aux réservations et aux commandes s’accompagne, d’après l’entreprise, d’une hausse des taux de traitement des appels. Yelp rapporte également une progression de la prise de tours et de la précision avec ce dispositif.
Voix, accents et style de conversation personnalisables
La gamme de voix en temps réel s’élargit à davantage d’accents, de dialectes et de langues, afin d’offrir plus de choix sur la signature sonore des assistants. Les développeurs peuvent ajuster le ton, le rythme et le style des échanges via le prompt système. La version API met l’accent sur ces capacités de pilotage et de personnalisation en fonction des utilisateurs, des workflows et des objectifs.
Un seul modèle pour écouter et parler, avec délégations en arrière‑plan
GPT‑Live‑1 regroupe l’écoute et la parole dans un modèle unique, ce qui simplifie la couche vocale. Cette intégration vise à éviter la latence et les transitions fragiles des enchaînements reconnaissance vocale–LLM–synthèse vocale, en raisonnant sur l’audio entrant et sortant de manière conjointe. Le modèle peut gérer en direct interruptions et acquiescements, puis déléguer un raisonnement plus poussé en arrière‑plan, permettant à la conversation de se poursuivre pendant que le travail se fait. Les délégations peuvent s’appuyer sur un modèle texte comme GPT‑6 Astra ou un modèle tiers. À l’inverse, les architectures traditionnelles segmentent reconnaissance, raisonnement et synthèse, et requièrent des coordinations supplémentaires côté développeurs, notamment lors des pauses, interruptions ou changements de cap. Le dispositif écoute et parle simultanément et prolonge des capacités de délégation déjà mises en avant avec Codex et ChatGPT Work. GPT‑Live‑1 avait d’abord été introduit dans ChatGPT.
Bruit géré, longues sessions et scénarios d’essai suggérés
Le modèle gère mieux le bruit de fond et les temps de silence, sans couper la conversation ni verbaliser chaque étape. Sur la durée, il améliore la rétention du contexte et la qualité des échanges. Il est suggéré d’expérimenter des conversations naturelles, y compris dans des environnements bruyants, d’interrompre en cours de réponse pour préciser une demande, d’essayer en marchant ou dans le bruit du quotidien, et d’introduire des hésitations ou de brèves interactions avec des tiers avant de reprendre l’échange.





