ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.
SavoirFin de tour de parole : attendre le silence ne suffit pas
Un agent vocal doit décider à chaque instant si la personne a fini sa phrase ou si elle reprend son souffle ; attendre un silence fixe, c'est couper la parole si l'on attend peu et faire attendre si l'on attend beaucoup, et aucune mesure publiée ne dit ce que cela donne en français, au téléphone.
Deux questions que l'on confond
« Est-ce qu'il parle encore ? » et « Est-ce qu'il a fini ? » ne sont pas la même question. La première est acoustique : il y a du son, ou il n'y en a pas. C'est le travail d'un détecteur d'activité vocale (VAD, pour voice activity detection), qui note la fin d'un segment de parole quand le silence dépasse un seuil. La seconde est une question de sens et de musique : « Je voudrais prendre rendez-vous… » suivi d'un silence n'est pas une fin de phrase, c'est une hésitation ; « Non merci. » suivi du même silence en est une. Les humains tranchent sans y penser, à l'intonation, au rythme, aux mots. Une machine qui n'écoute que le silence se trompe dans les deux sens.
Le compromis que le silence impose
Avec un seuil de silence, tout se règle par un seul chiffre : combien de millisecondes attendre. Attendre peu, et l'agent coupe la parole à chaque respiration. Attendre beaucoup, et chaque réponse arrive avec un blanc que la personne perçoit comme de la lenteur, ou comme une ligne coupée. Le banc d'essai ouvert de LiveKit, eot-bench, chiffre ce compromis pour un détecteur qui n'écoute que le silence (sur ses données de validation en anglais) : en répondant après 300 millisecondes de silence, on coupe la parole à tort 55,6 % du temps ; après 600 millisecondes, encore 21,7 % ; pour ne couper qu'une fois sur vingt, il faut attendre 1,6 seconde. Un modèle qui écoute aussi les mots et l'intonation fait beaucoup mieux : LiveKit annonce pour le sien, dans son billet de juin 2026, 9,9 % de coupures à tort avec 300 millisecondes de budget, 4,5 % avec 600. Ces chiffres sont les leurs, sur leurs données ; ils disent surtout une chose : on ne sort pas de ce compromis en réglant le seuil, on en sort en écoutant autre chose que le silence.
Ce que publient ceux qui travaillent le sujet
LiveKit a publié un modèle de détection de fin de tour et un banc d'essai ouvert, eot-bench, dont le jeu de données couvre quatorze langues, français et espagnol compris. Le billet donne des résultats par langue, mais ne dit rien de la téléphonie : les conversations sont enregistrées en large bande, entre un humain et un agent, jamais sur une ligne. Daily (Pipecat) propose Smart Turn v3, un modèle ouvert (licence BSD) de huit mégaoctets qui tourne en une douzaine de millisecondes sur un processeur ordinaire et couvre vingt-trois langues ; son corpus a été collecté auprès de la communauté, pas sur des appels réels, et là encore aucune mesure par langue ni au téléphone n'est publiée. Picovoice a écrit le guide le plus pédagogique sur la latence, le tour de parole et l'interruption, pour des assistants embarqués, en anglais. Kyutai, laboratoire français, publie une reconnaissance vocale en flux avec un « VAD sémantique » qui décide en une demi-seconde environ si la phrase est finie — ouvert, bilingue français-anglais, mais sans mesure au téléphone. Côté recherche, deux articles de 2026 montrent la direction : l'un apprend à prédire la durée du silence qui vient plutôt qu'à attendre qu'il passe (Next-Turn), l'autre cherche quels aspects de la parole portent vraiment l'information de fin de tour. Enfin, Luqia a publié en septembre 2026 le seul banc d'essai de dialogue en français que nous connaissions, ce qui dit assez combien le terrain est vide.
Pourquoi le téléphone change tout
Au téléphone, le son est étroit (bande 300-3 400 Hz) et compressé, les paquets se perdent, et l'intonation — précisément ce qui dit « j'ai fini » — s'entend moins bien. Les modèles cités ont appris sur de la parole en large bande ; rien ne dit comment ils se comportent sur une ligne, en français, avec quelqu'un qui parle vite parce qu'il est pressé de raccrocher. C'est une des raisons pour lesquelles le téléphone 8 kHz a sa propre page sur ce site.
Où en est ASDIC
En septembre 2026, sur les appels de Nodical, l'agent répond 0,14 seconde après avoir décidé que la personne avait fini (1,32 seconde pour 9 réponses sur 10). Ce chiffre exclut la décision elle-même : il mesure la génération de la réponse, pas l'attente. C'est donc la décision de fin de tour qui fait attendre, et c'est elle que nous ne savons pas encore mesurer sans un corpus annoté à la main — qui note, pour chaque tour, l'instant où la personne avait vraiment fini. Notre objectif est écrit comme un objectif : répondre en moins de 0,5 seconde, en coupant la parole moins de 5 % du temps. Il n'est pas atteint ; il sera publié avec la mesure qui le prouvera. La méthode et les limites de la mesure de septembre sont dans le carnet.
Ce que ça change pendant un appel
Un agent qui coupe la parole fait raccrocher ; un agent qui attend trop fait douter qu'il y ait quelqu'un. Entre les deux, il y a la différence entre une conversation et un formulaire vocal. Nodical décrit sur son site ce que ses agents font aujourd'hui pendant l'appel.
Et concrètement ? ce que Nodical fait aujourd'hui pendant l'appel
Sources
consultées le 1er octobre 2026.
- LiveKit, « Solving end-of-turn detection: Turn Detector v1.0 » (17 juin 2026) — https://livekit.com/blog/solving-end-of-turn-detection
- LiveKit, eot-bench (classement et jeu de données) — https://github.com/livekit/eot-bench
- Daily, « Announcing Smart Turn v3 » — https://www.daily.co/blog/announcing-smart-turn-v3-with-cpu-inference-in-just-12ms/
- Picovoice, « Voice agent latency, turn-taking, and barge-in » — https://picovoice.ai/guide/voice-agents/voice-ux-latency-turn-taking/
- Kyutai, reconnaissance vocale en flux avec « semantic VAD » — https://kyutai.org/stt/
- arXiv 2606.18094, « Next-Turn: duration-aware streaming endpoint detection » — https://arxiv.org/pdf/2606.18094
- arXiv 2609.11066, « Less can be More: what aspects of speech drive end-of-turn detection » — https://arxiv.org/pdf/2609.11066
- arXiv 2609.10765, Luqia, « French Full-Duplex Benchmark » (septembre 2026) — https://arxiv.org/abs/2609.10765
Corrections
Aucune correction à ce jour.