par Nodical

ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.

Savoir

Le vocabulaire de la voix au téléphone, en vingt mots

Publié le Par Douglas DemartÉtat du projet au 1er octobre 2026

En une phrase

Les pages sur les agents vocaux au téléphone parlent un jargon fait de sigles anglais ; voici les vingt mots qui reviennent le plus, définis chacun en quelques phrases simples et reliés à la page de ce site qui les développe.

Comment lire ce glossaire

Les agents vocaux ont leur jargon, souvent en anglais, souvent en sigles. Voici vingt termes, rangés dans l'ordre d'un appel plutôt que par ordre alphabétique, chacun relié à la page de ce site qui le développe. Les chiffres de tiers portent le nom de leur auteur ; leur source est en bas de page. Pour voir ces mots à l'œuvre dans un vrai appel, lisez Dix secondes : ce qui se passe au début d'un appel décroché.

Le son qui passe sur la ligne

Bande téléphonique

Les fréquences qu'une ligne téléphonique classique transmet : de 300 à 3 400 hertz, selon les recommandations de l'Union internationale des télécommunications (UIT). Le reste est coupé, et les consonnes aiguës comme « s » ou « f » en souffrent le plus. Voir Audio 8 kHz.

8 kHz

La fréquence d'échantillonnage du téléphone : 8 000 mesures du son par seconde, valeur fixée par la recommandation G.711 de l'UIT. Les modèles de reconnaissance vocale apprennent en général sur un son plus riche, dit « large bande », et entendent rarement celui-là. Voir Audio 8 kHz.

G.711 (loi A, loi µ)

Le codage historique de la voix téléphonique, normalisé par l'UIT : 8 000 échantillons par seconde, huit bits chacun, soit 64 000 bits par seconde. Il existe en deux variantes, la loi A et la loi µ (« mu »), qui compressent le son différemment ; entre deux pays qui n'utilisent pas la même, c'est la loi A qui circule. Voir Audio 8 kHz.

Qui parle, et quand

AMD (détection de répondeur)

Answering machine detection : la décision « humain ou messagerie » au début d'un appel sortant. Twilio indique que la sienne rend son résultat en environ quatre secondes avec les réglages par défaut ; sur les appels de Nodical, en septembre 2026, un répondeur est reconnu au bout de 8 secondes en médiane. Voir Détecter un répondeur et Le bip du répondeur.

VAD (détection d'activité vocale)

Voice activity detection : un détecteur qui dit, instant après instant, s'il y a de la parole ou non. Il ne comprend rien : il sépare la voix du silence et, plus ou moins bien, du bruit. Voir Le silence au téléphone.

Endpointing (détection de fin de parole)

La décision qu'un segment de parole est terminé, en général parce que le silence a dépassé un seuil. Le délai de réponse publié pour Nodical (0,14 seconde en médiane) est mesuré après cette décision, et ne la compte donc pas. Voir Fin de tour de parole.

Fin de tour

La décision que la personne a vraiment fini et que c'est à l'agent de parler : « Je voudrais… » suivi d'un silence n'en est pas une. Sur ses données de validation en anglais, le banc d'essai eot-bench de LiveKit montre qu'un détecteur qui n'écoute que le silence coupe la parole à tort 55,6 % du temps s'il répond après 300 millisecondes. Voir Fin de tour de parole.

Barge-in (interruption)

Parler pendant que l'autre parle. Un agent doit pouvoir être interrompu et se taire aussitôt ; quand c'est lui qui coupe la parole, c'est une faute. Le taux de coupure fera partie des mesures publiées par ASDIC ; il n'est pas encore mesuré. Voir Mesurer un agent vocal.

Diarisation

Savoir qui parle à quel moment, en séparant la voix de l'agent de celle de la personne. C'est simple quand chaque côté de l'appel est enregistré sur sa propre piste, plus dur quand les voix se chevauchent. Voir Pourquoi la reconnaissance vocale se trompe au téléphone.

Comment l'agent est construit

Full-duplex

Un système qui écoute et parle en même temps, au lieu d'attendre son tour. Luqia Technologies, qui a publié en septembre 2026 un banc d'essai full-duplex en français, décrit ces modèles comme capables d'écouter, de parler, de marquer une pause et de répondre pendant la conversation. Voir Pipeline ou speech-to-speech.

Speech-to-speech

Un modèle unique qui reçoit de la parole et en produit, sans passer par du texte. On l'oppose au pipeline, qui enchaîne reconnaissance vocale, modèle de langue et synthèse vocale, et qui se vérifie étape par étape. Voir Pipeline ou speech-to-speech.

Comprendre ce qui est dit

WER (taux d'erreur de mots)

Word error rate : les mots remplacés, oubliés et ajoutés, divisés par le nombre de mots prononcés ; dix mots dits, un remplacé et un oublié, cela fait 20 %. Pour Deepgram Nova-3, le comparatif de Vexascribe (août 2026) relève 2,6 % sur de la lecture propre et 21,8 % sur CallHome, un corpus d'appels téléphoniques. Voir Lire un benchmark.

SLU (compréhension de la parole)

Spoken language understanding : passer de ce qui est dit à ce que ça veut dire, l'intention et les informations utiles. En français, la référence est le corpus MEDIA, distribué par ELRA depuis 2005 et aujourd’hui gratuit pour la recherche académique. Voir Comprendre ce que la personne veut.

Intention

Ce que la personne veut, en une étiquette : « prendre rendez-vous », « être rappelé », « pas intéressé ». MEDIA n'était annoté qu'en concepts ; une version annotée en intentions a été publiée en 2024. Voir Comprendre ce que la personne veut.

Mesurer

Latence

Le temps que met l'agent à réagir. Le mot est vague : selon qui mesure, il part du dernier mot de la personne ou de la décision de fin de parole, et s'arrête au premier son de l'agent ou au premier octet envoyé. Avant de comparer, demandez où commence et où finit la mesure. Voir Mesurer un agent vocal et Évaluer un fournisseur de voix IA.

TTFAB (ou TTFA)

Time to first audio byte : le temps entre le moment où la personne se tait et le premier son de l'agent. OpenBenchmarks le mesure sur de vrais appels téléphoniques, les deux côtés enregistrés sur la même horloge ; ses relevés (dernier appel le 1er août 2026) donnent pour cinq plateformes des médianes de 1,3 à 1,7 seconde. Voir Mesurer un agent vocal.

Médiane, p90 et p95

La médiane partage les appels en deux moitiés : la moitié font mieux, la moitié moins bien. Le p90 est la valeur sous laquelle se trouvent 9 appels sur 10, le p95 celle sous laquelle s'en trouvent 19 sur 20 : ils décrivent les personnes qui ont attendu le plus, ce qu'une moyenne cache. Voir Évaluer un fournisseur de voix IA.

Les données dont l'agent apprend

Corpus annoté

Des enregistrements auxquels des personnes ont ajouté à la main ce qu'il fallait savoir : la transcription, l'instant où l'on reconnaît un répondeur, les fins de tours, les intentions. C'est ce qui permet d'entraîner un modèle et de mesurer ses erreurs ; il n'en existe aucun de public pour des appels réels en français. Voir Un corpus d'appels en français.

Pseudonymisation

Traiter des données pour qu'on ne puisse plus les rattacher à une personne sans une information supplémentaire, conservée à part et protégée (RGPD, article 4) ; pour un appel, cela veut dire retirer noms, numéros et adresses. Une donnée pseudonymisée reste une donnée personnelle (considérant 26) ; seule une donnée rendue anonyme sort du RGPD. Voir Un corpus d'appels en français.

Empreinte vocale

Une représentation calculée à partir de la voix pour reconnaître une personne précise. Le RGPD appelle « données biométriques » les données issues d'un « traitement technique spécifique » qui permettent ou confirment l'identification unique d'une personne ; un modèle qui reconnaît un répondeur ou une intention n'en a pas besoin, et ASDIC n'en fabriquera pas. Voir IA souveraine.

Ces mots dans un projet concret

Ces vingt mots servent à poser les bonnes questions avant de faire appeler ou répondre un agent vocal : à quelle vitesse il sait à qui il parle, s'il coupe la parole, ce qu'il comprend, ce que deviennent les enregistrements. Pour passer à la pratique, Nodical publie les guides pratiques de Nodical.

Et concrètement ? les guides pratiques de Nodical

Sources

consultées le 1er octobre 2026.

  1. UIT-T, Recommandation P.310, « Transmission characteristics for telephone band (300-3400 Hz) digital telephones » — https://www.itu.int/rec/T-REC-P.310
  2. UIT-T, Recommandation G.711, « Pulse code modulation (PCM) of voice frequencies » (8 000 échantillons par seconde, huit bits par échantillon, loi A et loi µ) — https://www.itu.int/rec/T-REC-G.711
  3. Twilio, « AMD FAQ & Best Practices » (résultat en environ 4 secondes avec les réglages par défaut) — https://www.twilio.com/docs/voice/answering-machine-detection-faq-best-practices
  4. LiveKit, eot-bench (classement et jeu de données) — https://github.com/livekit/eot-bench
  5. arXiv 2609.10765, Luqia Technologies, « French Full-Duplex Benchmark for Spoken Dialogue Models » (septembre 2026) — https://arxiv.org/abs/2609.10765
  6. Vexascribe, « How accurate is Deepgram? Nova-3 WER benchmarks (2026) » (mis à jour le 25 août 2026) — https://vexascribe.com/how-accurate-is-deepgram
  7. arXiv 2403.19727, MEDIA : nouvelle annotation en intentions (ELRA, distribué depuis 2005) — https://arxiv.org/abs/2403.19727
  8. OpenBenchmarks, « Voice agent latency benchmark (2026), TTFAB from real phone calls » (dernier appel : 1er août 2026) — https://openbenchmarks.com/voice-agent-latency
  9. Règlement (UE) 2016/679 (RGPD), article 4, définitions « pseudonymisation » et « données biométriques » — https://gdpr-info.eu/art-4-gdpr/
  10. RGPD, considérant 26 (données pseudonymisées et données anonymes) — https://gdpr-info.eu/recitals/no-26/
  11. ASDIC, carnet n° 1 : « Septembre 2026 : première mesure » — https://asdic.ai/carnet/2026-09-premiere-mesure

Corrections

Aucune correction à ce jour.