ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.
SavoirAudio 8 kHz : ce que les modèles n'entendent pas
Une ligne téléphonique ne transmet que les fréquences de 300 à 3 400 Hz, compressées et parfois trouées, alors que les modèles de reconnaissance vocale ont appris sur du son large et propre ; résultat, les bancs d'essai tiers mesurent au téléphone cinq à six fois plus d'erreurs qu'en lecture.
Ce qu'une ligne téléphonique laisse passer
Le téléphone a été conçu pour que l'on se comprenne, pas pour que l'on s'entende bien. Il ne transmet que les fréquences entre 300 et 3 400 hertz environ, ce qui se traduit par un son échantillonné à 8 kilohertz — deux fois moins que les 16 kilohertz sur lesquels la plupart des modèles de reconnaissance vocale ont appris, quatre à six fois moins qu'un enregistrement de studio. Les consonnes aiguës, les « s », les « f », les « t », vivent au-dessus de cette limite : au téléphone, « six » et « fils » se ressemblent. S'ajoutent la compression (G.711, loi A en Europe, loi µ en Amérique du Nord), qui réduit chaque échantillon à huit bits, et les pertes de paquets sur les réseaux mobiles et IP, qui trouent le signal par morceaux de vingt millisecondes.
Pourquoi un modèle « 16 kHz propre » s'effondre
Un modèle apprend ce qu'on lui montre. Les grands corpus publics sont faits de livres lus, de vidéos, de parole en large bande ; le téléphone y est rare, le téléphone en français plus rare encore. Quand on lui donne ensuite un son étroit, compressé et troué, le modèle n'a pas de mauvais réflexes : il n'a pas de réflexes du tout. Il rééchantillonne, il devine, et il se trompe surtout sur ce qui compte dans un appel court : un oui, un non, un chiffre, un nom.
Ce que mesurent les tiers
Les chiffres publics racontent la même histoire d'un modèle à l'autre. L'article qui présente Whisper, le modèle ouvert de référence, donne pour son plus grand modèle 2,7 % de mots erronés sur de la lecture propre, mais 13,8 à 17,6 % sur les corpus de conversation téléphonique en anglais (tableau 8). Pour Deepgram Nova-3, un comparatif indépendant mis à jour en août 2026 relève 2,6 % sur la lecture propre et 21,8 % sur CallHome, un corpus d'appels téléphoniques ; son auteur résume : « même le meilleur moteur rate à peu près un mot sur cinq au téléphone », et attend 18 à 24 % d'erreurs sur de la conversation à 8 kilohertz. Google propose d'ailleurs un modèle de transcription distinct pour les appels téléphoniques, signe que le cas est à part. Et Coval, qui publie des comparatifs indépendants, rappelle que les bancs d'essai standard ne reflètent « ni vos scripts, ni vos appelants, ni vos accents » : la seule mesure qui compte est celle faite sur ses propres appels.
Deux absences dans tout cela : aucun de ces chiffres n'est en français, et aucun n'est en espagnol. Le classement public le plus utilisé, l'Open ASR Leaderboard, a une piste multilingue mais pas de piste téléphone.
Ce que ça change pour un agent qui appelle
Un mot sur cinq en moins, ce n'est pas une transcription un peu moins jolie : c'est une intention manquée, un rendez-vous noté au mauvais jour, un « non » pris pour un « oui ». Et comme nos appels durent dix secondes en médiane, il n'y a pas de deuxième chance pour se rattraper sur le contexte. C'est pour cela qu'ASDIC apprend sur de l'audio téléphonique dès le départ, en français, en espagnol et en anglais, plutôt que d'adapter un modèle large bande après coup.
Où en est ASDIC
Nous n'avons pas encore de mesure de taux d'erreur de mots sur nos appels : elle demande un corpus transcrit à la main, qui est précisément le lot pilote du programme. Quand elle existera, elle sera publiée dans le carnet, avec la méthode, en français d'abord, puis en espagnol et en anglais, sur du son 8 kilohertz tel qu'il arrive sur la ligne. Ce sera, à notre connaissance, la première mesure publique de ce type en français.
Pourquoi le volume d'appels change la donne
Un modèle de téléphonie s'entraîne sur des appels, et personne n'en a autant qu'une plateforme qui en passe chaque jour. Nodical explique sur son site pourquoi le volume d'appels change la donne pour les agences et les centres d'appels.
Et concrètement ? pourquoi le volume d'appels change la donne
Sources
consultées le 1er octobre 2026.
- OpenAI, « Robust Speech Recognition via Large-Scale Weak Supervision » (article Whisper, tableau 8) — https://cdn.openai.com/papers/whisper.pdf
- Vexascribe, « How accurate is Deepgram? Nova-3 WER benchmarks (2026) » (mis à jour le 25 août 2026) — https://vexascribe.com/how-accurate-is-deepgram
- Google Cloud, « Sélectionner un modèle de transcription » (modèle dédié aux appels téléphoniques) — https://docs.cloud.google.com/speech-to-text/docs/v1/transcription-model?hl=fr
- Deepgram, « Noise-robust speech recognition » — https://deepgram.com/learn/noise-robust-speech-recognition-techniques
- Coval, « Best STT providers 2026: independent benchmarks » (sur la limite des bancs d'essai standard) — https://www.coval.ai/blog/best-speech-to-text-providers-in-2026-independent-benchmarks-and-how-to-choose/
Corrections
Aucune correction à ce jour.