OpenAI lance le modèle vocal full-duplex GPT-Live
fr.wedoany.com Rapport : L'entreprise américaine d'intelligence artificielle OpenAI a dévoilé un nouveau modèle vocal, GPT-Live, conçu pour des interactions vocales homme-machine plus naturelles. Basé sur une architecture full-duplex, ce modèle peut écouter en continu et répondre en temps réel, sans dépendre entièrement du mode « l'utilisateur termine une phrase, puis le système commence à répondre » des assistants vocaux traditionnels.
GPT-Live sera proposé en deux versions : GPT-Live-1 et GPT-Live-1 mini. GPT-Live-1 deviendra le modèle vocal par défaut de ChatGPT Voice pour les utilisateurs Go, Plus et Pro, tandis que GPT-Live-1 mini sera le modèle vocal par défaut pour les utilisateurs Free. OpenAI indique que GPT-Live est en cours de déploiement progressif auprès des utilisateurs de ChatGPT dans le monde entier, couvrant iOS, Android et ChatGPT.com.
Le full-duplex est au cœur de cette évolution du modèle. Les interactions vocales traditionnelles nécessitent généralement d'attendre une pause ou la fin de l'énoncé de l'utilisateur avant de décider de répondre, ce qui peut entraîner des problèmes tels que des interruptions intempestives, des omissions d'écoute, des délais ou une expérience de coupure peu naturelle. GPT-Live peut surveiller en continu l'entrée vocale pendant la conversation, tout en déterminant si l'utilisateur fait une pause, ajoute des informations, se corrige ou souhaite une réponse immédiate du modèle. Le modèle peut gérer les pauses, les interruptions, les variations de débit et les changements de rythme de la conversation, rendant l'interaction vocale plus proche de la communication en temps réel entre humains.
GPT-Live est destiné aux scénarios d'agents vocaux en temps réel. Le modèle doit simultanément effectuer la compréhension vocale, le suivi du contexte, la génération de réponses et le contrôle de la sortie vocale, tout en décidant quand continuer à écouter, quand intervenir avec une réponse et quand attendre que l'utilisateur complète son propos. Par rapport au processus simple de transcription vocale en texte puis de génération de réponse, le modèle vocal full-duplex intègre l'écoute, la réflexion et la parole dans un même système d'interaction continue, ce qui impose des exigences plus élevées en matière de contrôle de la latence, de détection d'activité vocale, de maintien du contexte et de gestion des tours de parole.
OpenAI a également publié la fiche système de GPT-Live, précisant que GPT-Live-1 et GPT-Live-1 mini appartiennent à une nouvelle génération de modèles vocaux, visant à rendre les dialogues IA plus naturels et plus intelligents. La fiche mentionne que la capacité full-duplex permet au modèle d'écouter et de répondre en continu, plutôt que d'attendre la fin d'un tour de parole explicite pour agir.
Sur le plan du produit, GPT-Live fait d'abord son entrée dans ChatGPT Voice. Les utilisateurs peuvent dialoguer vocalement avec ChatGPT sur mobile ou sur le web, et le modèle répond en temps réel en fonction du contenu de l'entrée vocale et du contexte de la conversation. Pour les applications telles que les assistants vocaux, les robots de service client, les coachs éducatifs, l'assistance en réunion, les interactions embarquées et les applications de compagnie en temps réel, les indicateurs clés de ce type de modèle se concentreront sur la latence de réponse, la gestion des interruptions, la reconnaissance des pauses naturelles, les dialogues multi-tours continus et la stabilité de la sortie vocale.
Côté API, OpenAI a ouvert le portail d'inscription aux notifications pour l'API GPT-Live-1, permettant aux développeurs de demander à être informés des futures disponibilités. Si GPT-Live est intégré à l'API par la suite, les entreprises et les développeurs pourront connecter les capacités vocales full-duplex à des produits tels que les services vocaux clients, les appareils intelligents, la traduction en temps réel, la collaboration à distance et les agents vocaux sectoriels.
Produits Associés

Terminal satellite portable à panneau plat - Terminal portable manuel de 0,35 mètre
China Starwin Science & Technology co., Ltd.
Radar de profil de vent troposphérique TWP16 en bande P
China Huayun Meteorological Technology Group Co., Ltd.


Commutateur industriel entièrement national
Shenzhen Yuhang Communication Technology Co., Ltd.
Tour de communication à quatre colonnes pour les lignes dédiées aux passagers
Henan Dingli Pole & Tower Co.,Ltd.
Logiciel de serveur d'applications Baolande V9.5
Beijing Baolande Software Corporation
Réflectomètre optique dans le domaine temporel (OTDR) 6422
Ceyear Technologies Co., Ltd.
Système de surveillance intelligente pour bande transporteuse
LUO YANG WIRE ROPE INSPECTION TECHNOLOGY CO., LTD.
Calibrateur de pression automatique intelligent ConST811A
Beijing ConST Instruments Technology Inc.
Solution de Prévention des Fuites de Données pour Bureaux
Sangfor Technologies Inc.
Tablette PC industrielle robuste 10 pouces Win10 Win11 Pro Intel N100 16+512 Go IP67 4G avec code-barres NFC RJ45 et station d'accueil
Highton Electronics Co., Ltd.








