ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.
SavoirLire un benchmark de reconnaissance vocale sans se faire avoir
Un taux d'erreur de mots n'a de sens qu'avec trois précisions — sur quel audio, avec quelle normalisation du texte, mesuré par qui — et le même modèle peut afficher 2,7 % sur des livres lus et 17,6 % sur des appels téléphoniques sans qu'aucun des deux chiffres soit faux.
Ce que compte le taux d'erreur de mots
Presque tous les comparatifs de reconnaissance vocale donnent un seul chiffre : le taux d'erreur de mots, ou WER (word error rate). On aligne la transcription de la machine sur une transcription de référence, écrite à la main, et l'on compte trois sortes d'erreurs : les substitutions (un mot remplacé par un autre), les suppressions (un mot dit mais absent) et les insertions (un mot écrit mais jamais dit).
WER = (substitutions + suppressions + insertions) ÷ nombre de mots de la référence
Les insertions s'ajoutant sans limite, le WER peut dépasser 100 % : si la personne dit « oui » et que la machine écrit « oui oui c'est ça », cela fait trois insertions pour un mot, soit 300 %.
Un exemple calculé à la main
La personne dit : « oui je suis disponible jeudi à dix heures » — 8 mots. La machine écrit : « euh oui suis disponible lundi à dix heures ». On aligne mot à mot :
| Référence | Transcription | Verdict |
|---|---|---|
| — | euh | insertion |
| oui | oui | juste |
| je | — | suppression |
| suis | suis | juste |
| disponible | disponible | juste |
| jeudi | lundi | substitution |
| à | à | juste |
| dix | dix | juste |
| heures | heures | juste |
Une substitution, une suppression, une insertion : 3 erreurs pour 8 mots, soit 3 ÷ 8 = 37,5 %. Les trois ne se valent pas : « euh » et « je » ne changent rien au sens, « lundi » envoie le rendez-vous au mauvais jour. Le WER les compte pareil.
La normalisation, règle du jeu qu'on ne lit pas
Si l'on retire les hésitations avant de compter, « euh » disparaît : il reste 2 erreurs, et le WER tombe à 2 ÷ 8 = 25 %, sans qu'une lettre de la transcription ait changé. À l'inverse, si la machine avait écrit « 10h » au lieu de « dix heures », un calcul naïf compterait deux erreurs de plus (« 10h » pour « dix », « heures » supprimé) : 5 ÷ 8 = 62,5 %, pour une heure parfaitement juste.
C'est pourquoi les bancs d'essai « normalisent » les textes avant de compter. Pour l'anglais, l'Open ASR Leaderboard, le classement public le plus utilisé, retire ponctuation et majuscules, écrit les nombres en lettres, uniformise l'orthographe et supprime les mots d'hésitation. Ces choix pèsent : les auteurs de Whisper écrivent que leur normalisation a fait baisser le WER jusqu'à moitié sur certains jeux de test, souvent à cause d'une particularité des références, et préviennent qu'une normalisation mise au point avec un modèle risque de l'avantager. Vexascribe, qui compile des comparatifs, résume : une comparaison de WER n'est valable qu'avec le même audio et la même normalisation pour chaque moteur.
Lecture contre conversation
L'article qui présente Whisper donne pour son plus grand modèle (tableau 8) 2,7 % d'erreurs sur LibriSpeech, des livres audio lus, mais 13,8 % sur Switchboard et 17,6 % sur CallHome, deux corpus de conversations téléphoniques en anglais. Il montre plus net encore (tableau 2) : un autre modèle, wav2vec 2.0, fait le même score sur LibriSpeech, 2,7 %, mais 34,8 % sur CallHome. Sur des livres lus, égalité ; au téléphone, l'un se trompe deux fois plus que l'autre. Les auteurs en concluent qu'il faut évaluer hors des conditions d'entraînement, pour ne pas surestimer les modèles.
Les classements publics héritent de ce choix. D'après l'article qui le décrit (octobre 2025), l'Open ASR Leaderboard évalue le français et l'espagnol sur trois jeux de parole lue — CoVoST-2, FLEURS et MLS — et n'a aucune piste consacrée au téléphone. Ses auteurs le disent : aucun modèle ne gagne partout, aucun jeu de test ne suffit, et le WER seul ne suffit pas.
16 kHz contre 8 kHz
LibriSpeech, le jeu le plus cité, est de la parole lue enregistrée à 16 kilohertz. Une ligne téléphonique ne transmet que les fréquences de 300 à 3 400 hertz, échantillonnées à 8 kilohertz et compressées. Pour Deepgram Nova-3, Vexascribe relève 2,6 % d'erreurs sur LibriSpeech et 21,8 % sur CallHome, et attend 18 à 24 % sur de la conversation téléphonique à 8 kilohertz : plus de huit fois plus d'erreurs entre le livre lu et l'appel. Un chiffre mesuré sur du son large et propre n'est pas un chiffre de téléphonie (voir Audio 8 kHz : ce que les modèles n'entendent pas et les six causes d'erreur au téléphone).
Qui a mesuré : l'éditeur ou un tiers
Un même modèle peut porter trois chiffres sans qu'aucun soit faux. Deepgram annonce pour Nova-3 un WER médian de 5,26 % en transcription différée, sur un jeu de test qu'il a constitué : 2 703 fichiers audio, neuf domaines, 81,69 heures. Vexascribe relève pour le même modèle 2,6 % sur LibriSpeech et 21,8 % sur CallHome, et rappelle qu'une médiane entre jeux de test masque les pires domaines. Coval, qui vend des outils d'évaluation, ajoute un piège : selon elle, le WER en temps réel est en général de 1 à 3 points plus élevé qu'en différé sur le même modèle ; un chiffre « différé » ne se compare donc pas à un chiffre « temps réel ». La bonne attitude n'est pas la méfiance, c'est la question.
Ce qu'un chiffre moyen cache
Un WER « moyen » se calcule de deux façons. Première phrase : la personne dit « non merci », la machine écrit « oui merci » — une erreur sur deux mots, 50 %. Seconde phrase : dix-huit mots, tous justes, 0 %. La moyenne des deux phrases donne 25 % ; le total des erreurs sur le total des mots, 1 ÷ 20 = 5 %. Les deux calculs sont justes, et aucun ne dit que la seule erreur a changé un refus en accord. Une moyenne sur plusieurs jeux de test mélange de même des conditions sans rapport : dans l'article de Whisper, les 12,8 % de moyenne du plus grand modèle (tableau 2) recouvrent 2,7 % sur des livres lus et 36,4 % sur des réunions captées par un micro posé à distance.
Six questions avant de croire un chiffre
- Quel jeu de test ? Lu ou spontané, livres ou appels, dans quelle langue.
- Quel son ? Large bande, ou ligne téléphonique à 8 kilohertz.
- Quelle normalisation ? Hésitations, nombres, majuscules : retirés ou comptés.
- Quel mode ? Différé ou temps réel.
- Quel calcul ? Total des erreurs, moyenne par phrase, médiane par domaine.
- Qui a mesuré ? L'éditeur ou un tiers, et la méthode est-elle publiée.
Nous n'avons pas encore de WER mesuré sur nos appels : il faut un corpus transcrit à la main, qui est le lot pilote du programme. Quand il existera, le chiffre sera publié dans le carnet avec ces six réponses. D'ici là, nous ne citons que des chiffres de tiers, avec leur nom et leur source. Pour les questions qui dépassent la transcription : Évaluer un fournisseur de voix IA : dix questions à poser.
Ce que Nodical sait faire aujourd'hui
Un taux d'erreur de mots ne dit pas si un appel a servi à quelque chose : un rendez-vous posé au bon jour, un client rappelé, un dossier à jour. C'est ce que décrit la page ce que Nodical sait faire aujourd'hui, autour de l'agent vocal.
Et concrètement ? ce que Nodical sait faire aujourd'hui
Sources
consultées le 1er octobre 2026.
- OpenAI, « Robust Speech Recognition via Large-Scale Weak Supervision » (article Whisper : section 3.2 sur la normalisation, tableaux 2 et 8) — https://cdn.openai.com/papers/whisper.pdf
- arXiv 2510.06961, « Open ASR Leaderboard » (jeux de test, normalisation du texte, octobre 2025) — https://arxiv.org/html/2510.06961v1
- Vexascribe, « How accurate is Deepgram? Nova-3 WER benchmarks (2026) » (mis à jour le 25 août 2026) — https://vexascribe.com/how-accurate-is-deepgram
- Deepgram, « Introducing Nova-3: setting a new standard for AI-driven speech-to-text » (jeu de test de l'éditeur) — https://deepgram.com/learn/introducing-nova-3-speech-to-text-api
- Coval, « Best STT providers 2026: independent benchmarks and how to choose » (4 juin 2026) — https://www.coval.ai/blog/best-speech-to-text-providers-in-2026-independent-benchmarks-and-how-to-choose/
- OpenSLR, LibriSpeech ASR corpus (« environ 1 000 heures de parole anglaise lue à 16 kHz ») — https://www.openslr.org/12
Corrections
Aucune correction à ce jour.