ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.
SavoirPourquoi la reconnaissance vocale se trompe au téléphone
Un moteur qui transcrit presque parfaitement un livre lu rate à peu près un mot sur cinq au téléphone, pour six raisons qui s'additionnent — et dans un appel de dix secondes, un mot sur cinq, c'est souvent le mot qui comptait.
L'écart entre le banc d'essai et la ligne
Les éditeurs annoncent des taux d'erreur de quelques pour cent. Ils sont vrais — sur de la parole lue, propre, en large bande. Au téléphone, les mêmes moteurs se trompent beaucoup plus : un comparatif indépendant d'août 2026 résume que « même le meilleur moteur rate à peu près un mot sur cinq » sur de la conversation téléphonique, et Deepgram lui-même écrit que les centres d'appels constatent en production 35 à 50 % de mots erronés, contre 3 à 5 % sur les bancs d'essai propres. L'écart n'a pas une cause : il en a six, et elles s'additionnent.
1. La bande étroite
La ligne ne transmet que les fréquences de 300 à 3 400 hertz, compressées à huit bits. Les consonnes aiguës disparaissent, « six » ressemble à « fils ». C'est la cause de fond, celle sur laquelle les autres se greffent ; elle a sa propre page.
2. Le bruit
Une rue, une voiture, une cuisine, un bureau ouvert : la personne appelée n'est jamais dans un studio. Deepgram cite des mesures où un fond de voix (« babble ») fait passer le taux d'erreur de 5,5 % quand la voix domine nettement à 15,2 % quand le bruit est aussi fort qu'elle. Le bruit change d'une seconde à l'autre, et un modèle entraîné sur du son calme n'a pas appris à l'ignorer.
3. Les accents
Un modèle apprend l'accent de ses données. Une étude de 2025 a évalué cinq moteurs sur de l'anglais parlé par des personnes de six langues maternelles différentes : tous se dégradent entre la parole lue et la parole spontanée, et aucun ne tient sur tous les accents à la fois. En français, la question est la même, et personne ne l'a mesurée au téléphone : un accent du Sud, du Nord, de Belgique, du Maghreb, et le modèle « standard » n'a appris qu'une partie de la France.
4. Les chevauchements
Au téléphone, on se coupe. La personne répond avant la fin de la question, l'agent reprend avant la fin de la réponse, deux voix se superposent pendant une demi-seconde. Les moteurs transcrivent une voix à la fois ; sur un chevauchement, ils en choisissent une, mélangent les deux, ou laissent un trou. Et dans un appel court, le chevauchement tombe justement sur le « oui » ou le « non » qu'on attendait.
5. Les noms propres
Un nom de famille, une rue, une entreprise, une marque : le modèle ne les connaît pas, il devine un mot courant qui sonne pareil. « Madame Lannoy » devient « Madame la noix ». Pour un agent qui doit noter avec qui il a parlé et où rappeler, c'est le mot le plus important de l'appel, et c'est celui que le moteur a le moins de chances d'avoir.
6. Les chiffres
Un numéro de téléphone, un code postal, une date, une heure, un montant. Les chiffres sont courts, dits vite, souvent en série, et la bande étroite les rend tous un peu pareils. Un seul chiffre faux dans un numéro de rappel, et le rappel n'aura jamais lieu — sans que personne ne le sache.
Ce que ça coûte dans un appel de dix secondes
Sur nos appels de septembre 2026, la moitié des appels décrochés durent dix secondes ou moins : une vingtaine de mots. Un mot sur cinq raté, c'est quatre ou cinq mots, et ils ne tombent pas au hasard : les noms, les chiffres, le « non » dit sur le bruit sont exactement les mots que les six causes visent. La transcription peut avoir l'air correcte et l'appel être compris de travers.
Où en est ASDIC
Nous n'avons pas encore de taux d'erreur mesuré sur nos appels : il faut un corpus transcrit à la main, qui est le lot pilote du programme. Quand il existera, chaque erreur sera rangée dans l'une des six causes, pour savoir sur laquelle travailler d'abord — nous ne savons pas encore laquelle pèse le plus en français au téléphone, et nous préférons le dire. Les exemples sonores par cause viendront du même corpus, anonymisés, pas avant.
Rappeler vite ne sert à rien si l'on comprend mal
Un agent qui rappelle dans la minute mais note le mauvais nom ou le mauvais numéro a perdu le contact plus sûrement qu'un agent lent. Nodical explique sur son site comment rappeler un lead en moins de 60 secondes — et ce qu'il faut avoir compris avant de rappeler.
Et concrètement ? rappeler vite ne sert à rien si l'on comprend mal
Sources
consultées le 1er octobre 2026.
- Deepgram, « Noise-robust speech recognition » (centres d'appels : 35 à 50 % d'erreurs en production contre 3 à 5 % sur les bancs d'essai propres) — https://deepgram.com/learn/noise-robust-speech-recognition-techniques
- Vexascribe, « How accurate is Deepgram? » (« même le meilleur moteur rate à peu près un mot sur cinq au téléphone », août 2026) — https://vexascribe.com/how-accurate-is-deepgram
- arXiv 2503.06924, « Automatic Speech Recognition for Non-Native English: Accuracy and Disfluency Handling » (mars 2025) — https://arxiv.org/abs/2503.06924
- arXiv 2510.06961, « Open ASR Leaderboard » — https://arxiv.org/html/2510.06961v1
- ASDIC, « Audio 8 kHz : ce que les modèles n'entendent pas » — https://asdic.ai/savoir/audio-8-khz-ce-que-les-modeles-n-entendent-pas
Corrections
Aucune correction à ce jour.