Le nouveau mode vocal de ChatGPT propose des conversations plus fluides grâce au modèle GPT-Live, qui écoute et parle en même temps, avec trois niveaux de réponse variant en rapidité et en temps de réflexion. Le mode est disponible via l’application ChatGPT sur les appareils iPhone et Android ainsi que sur le navigateur web, tandis que la version du modèle accessible diffère selon les formules gratuites et payantes.
Comment activer le mode vocal
La conversation peut être lancée en appuyant sur l’icône vocale, qui se présente sous la forme d’une onde sonore à l’extrême droite de la zone de saisie. Lors de la première utilisation, l’application demande l’autorisation d’accéder au microphone de l’appareil, puis un cercle flottant animé apparaît à l’écran et l’utilisateur peut parler naturellement.
Le mode vocal reste actif lorsque l’utilisateur passe à une autre application ou verrouille l’écran de son téléphone. Il peut également interrompre ChatGPT ou continuer à parler sans attendre la fin de la réponse, le modèle étant désormais moins susceptible de considérer une courte pause comme la fin d’une phrase, afin de rendre les longues conversations plus fluides.
Trois niveaux de réponse
Le niveau d’intelligence du modèle vocal peut être modifié depuis l’icône des paramètres en haut de l’écran. GPT-Live démarre automatiquement au niveau Instant, mais il peut transmettre en arrière-plan les questions nécessitant des recherches ou une réflexion plus approfondie à d’autres modèles. Le choix de Medium ou de High peut augmenter le temps de réponse d’une ou deux secondes, notamment lors de discussions répétées sur des sujets complexes.
Comment le mode vocal a-t-il évolué ?
La première version de Voice Mode, lancée par OpenAI en 2023, reposait sur trois systèmes distincts : la conversion de la parole de l’utilisateur en texte, la génération de la réponse par un modèle linguistique, puis sa conversion en voix. L’entreprise a ensuite lancé Advanced Voice Mode, fondé sur un modèle multimodal afin d’accélérer les conversations et de les rendre plus naturelles, avant que GPT-Live ne le remplace comme option par défaut.
GPT-Live repose sur une architecture qu’OpenAI décrit comme Full-Duplex, qui permet au modèle d’écouter et de parler en même temps. Cela contribue à réduire les interruptions lorsque l’utilisateur s’arrête brièvement et rend les échanges plus proches des conversations naturelles. Parmi les changements apportés par le modèle figure la production de courtes réactions vocales pendant que l’utilisateur parle, comme « Hmm » ou « Oui ».
Selon le document source, GPT-Live peut faire appel en arrière-plan à des modèles plus performants, comme GPT-5.5, lorsque la question nécessite davantage de réflexion ou de recherche, tout en maintenant la conversation vocale sans interruption perceptible.
Différences entre les formules et fonctionnalités disponibles
Les abonnés à ChatGPT Pro, Plus et Go bénéficient du modèle GPT-Live-1, tandis que les utilisateurs de la formule gratuite utilisent GPT-Live-1 mini. Selon le rapport, la version GPT-Live-1 mini ne permet pas de personnaliser le niveau d’intelligence, ce qui réserve cette possibilité aux formules payantes.
La rapidité de réponse de GPT-Live peut être mise à profit pour la traduction lors de conversations en direct. L’utilisateur peut également faire défiler l’écran vers le bas pour consulter la transcription de ce que disent les deux interlocuteurs. Si ChatGPT estime que la réponse nécessite un élément visuel, il peut créer un élément interactif (Widget) à côté de la réponse vocale afin de contribuer à sa compréhension.
GPT-Live ne prend actuellement pas en charge le partage d’écran ni la vidéo. L’utilisateur peut toutefois revenir à l’ancien modèle vocal depuis les paramètres de ChatGPT, en ouvrant la section Voice et en sélectionnant un autre modèle. Cette même section permet de modifier la voix de ChatGPT et de définir la langue, ainsi que de configurer Voice Mode comme mode par défaut au démarrage de l’application.
