ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.
SavoirÉvaluer un fournisseur de voix IA : dix questions à poser
Une fiche commerciale donne un chiffre ; dix questions simples disent ce qu'il vaut — sur quel audio, dans quelle langue, sur quelle ligne, en médiane ou au pire, mesuré par qui — et ce que devient la voix des personnes appelées, chez qui, combien de temps, et quand tout s'arrête.
Pourquoi des questions plutôt qu'un classement
Aucun classement ne dit quel agent vocal conviendra à vos appels. Les chiffres publiés sont souvent exacts, mais mesurés ailleurs : autre audio, autre langue, autre ligne. Coval, une société qui vend des outils d'évaluation d'agents vocaux, l'écrit en juin 2026 : les bancs d'essai des éditeurs sont « des textes publicitaires accompagnés de mesures » ; les chiffres sont vrais, les conditions sont choisies pour flatter. Elle range ses objections sous trois questions : dans quelles conditions, mesuré comment, comparé à quoi. Nous les détaillons ici en dix. Aucune ne demande d'être ingénieur ; toutes appellent une réponse écrite, avec des noms. Cette page ne recommande aucun produit : elle compare des réponses, pas des marques.
Cinq questions sur la mesure
1. Sur quel audio avez-vous mesuré ?
Des livres lus, des vidéos, des réunions, ou de vrais appels ? Coval rappelle que les jeux de test standard ne reflètent « ni vos scripts, ni vos appelants, ni vos accents ». Une bonne réponse nomme le jeu de test, donne sa taille et dit s'il ressemble à vos appels : sortants ou entrants, courts ou longs. « En conditions réelles », sans autre détail, n'est pas une réponse.
2. Dans quelle langue ?
Un chiffre en anglais ne dit rien du français. D'après l'article qui le décrit (octobre 2025), l'Open ASR Leaderboard, le classement public le plus utilisé en reconnaissance vocale, évalue le français sur trois jeux de parole lue : CoVoST-2, FLEURS et MLS. Demandez le chiffre dans votre langue et, si vos clients ont des accents variés — du Sud, du Nord, de Belgique, du Maghreb —, sur ces accents.
3. Au téléphone (8 kHz) ou en large bande ?
Une ligne téléphonique ne transmet que les fréquences de 300 à 3 400 hertz, échantillonnées à 8 kilohertz. L'écart n'a rien d'un détail : dans l'article qui présente Whisper, le même modèle fait 2,7 % de mots erronés sur des livres lus et 17,6 % sur CallHome, un corpus d'appels téléphoniques en anglais. Demandez un chiffre mesuré sur du son de ligne (voir Audio 8 kHz : ce que les modèles n'entendent pas).
4. La médiane, et le p95 ?
La médiane dit ce que vit un appel ordinaire ; le p95, la valeur sous laquelle tombent 95 mesures sur 100, dit ce que vivent ceux qui attendent le plus. Coval qualifie une latence médiane mesurée dans des conditions idéales de « chiffre de marketing ». OpenBenchmarks, qui chronomètre le délai de réponse de cinq plateformes sur de vrais appels téléphoniques, publie les deux : en août 2026, des médianes de 1,3 à 1,7 seconde et des p95 de 1,8 à 2,3 secondes. Demandez aussi ce qui est chronométré, et de quand à quand (voir Mesurer un agent vocal : les cinq chiffres qui comptent).
5. Qui a mesuré : vous, ou un tiers ?
Une mesure faite par l'éditeur sur son propre jeu de test n'est pas fausse ; elle n'est pas vérifiable. Un tiers l'a-t-il refaite ? La méthode est-elle publique, comme celles d'OpenBenchmarks et de l'Open ASR Leaderboard, qui publient leur code ? Est-elle refaite quand le modèle change ? Coval signale des mises à jour poussées par les éditeurs sans changement de numéro de version. Le plus sûr reste de mesurer sur un échantillon de vos propres appels (voir Lire un benchmark de reconnaissance vocale sans se faire avoir).
Quatre questions sur les données
6. Où passe l'audio ?
Opérateur téléphonique, reconnaissance vocale, modèle de langue, synthèse vocale, stockage : la voix d'une personne appelée traverse plusieurs services. Demandez, pour chacun, l'entreprise et le pays. « Hébergé en Europe » peut ne viser que la base de données (voir IA souveraine : ce que ça veut dire pour une conversation téléphonique).
7. Combien de temps est-il gardé ?
Enregistrements, transcriptions, résumés : chacun a sa durée. Pour l'enregistrement des appels, la CNIL indique que la durée de conservation varie selon l'objectif poursuivi ; pour la preuve d'un contrat, elle rappelle que le délai de prescription de droit commun est de cinq ans. Une réponse sérieuse donne une durée par usage, dit ce qui se passe à la fin (suppression ou anonymisation) et précise si vos appels servent à entraîner les modèles du fournisseur.
8. Qui sont vos sous-traitants ?
Le RGPD (article 28) interdit à un sous-traitant d'en engager un autre sans l'autorisation écrite du responsable du traitement, et l'oblige à prévenir de tout changement pour qu'on puisse s'y opposer. Demandez la liste nominative, avec le pays et le rôle de chacun. Une liste publiée vaut mieux qu'une liste « disponible sur demande ».
9. Comment une personne appelée s'oppose-t-elle ?
Ce n'est pas à la personne appelée de chercher comment dire non. La CNIL demande une mention orale, en début de conversation, qui annonce l'enregistrement et sa finalité et informe de la possibilité de s'y opposer. Depuis le 2 août 2026, l'AI Act (article 50) impose en plus qu'une personne sache qu'elle parle à une IA. Demandez ce que dit l'agent dans les premières secondes, ce qui se passe si la personne refuse, et comment son numéro est ensuite exclu.
Une question sur la panne
10. Que se passe-t-il à une coupure ?
Si un maillon de la chaîne tombe, que devient l'appel en cours ? L'agent se tait-il, raccroche-t-il, passe-t-il la main à un humain ou à un autre fournisseur ? Que deviennent les appels programmés, et qui est prévenu ? Demandez le récit d'une panne passée. Un fournisseur qui n'a jamais eu de panne n'existe pas ; un fournisseur qui sait raconter la sienne, si.
Les réponses qui doivent faire tiquer
- Un taux de précision sans jeu de test, sans langue et sans qualité de ligne.
- Une seule « latence », sans dire ce qui est chronométré ni donner de p95.
- « Hébergé en Europe » sans liste de sous-traitants.
- « Conforme au RGPD » en réponse à une question précise.
- Rien d'écrit sur ce qui se passe en cas de panne.
Aucune de ces réponses ne prouve qu'un produit est mauvais. Elles prouvent seulement qu'on ne sait pas encore s'il est bon.
Nos propres réponses, côté mesure
Nous nous posons les mêmes questions. Quel audio ? Nos appels de production : en septembre 2026, 60 287 appels décrochés par un humain, 14 campagnes, en français, mesurés sans lire le contenu des conversations. Médiane et valeur haute ? Le répondeur est reconnu à 8 secondes en médiane, à 14 secondes pour 9 appels sur 10. Qui a mesuré ? Nous seuls : aucun tiers n'a refait la mesure. Quelle part de la chaîne est à nous ? Aucun modèle de compréhension propre aujourd'hui — 0 % — ; la voix et la reconnaissance vocale reposent sur un prestataire américain, nommé avec les autres sous-traitants dans la politique de confidentialité de Nodical. Le détail est dans le carnet n° 1.
Ce que Nodical répond à ces dix questions
Les dernières questions touchent au service plus qu'à la recherche : comment un appel est facturé, quand l'agent passe la main à un humain, quelle trace reste de chaque appel, comment on arrête. Nodical publie sa réponse en comparant point par point un plateau d'appels et un agent vocal : ce que Nodical répond à ces dix questions.
Et concrètement ? ce que Nodical répond à ces dix questions
Sources
consultées le 1er octobre 2026.
- Coval, « Best STT providers 2026: independent benchmarks and how to choose » (4 juin 2026) — https://www.coval.ai/blog/best-speech-to-text-providers-in-2026-independent-benchmarks-and-how-to-choose/
- OpenBenchmarks, « Voice agent latency benchmark (2026), TTFAB from real phone calls » (dernier appel : 1er août 2026) — https://openbenchmarks.com/voice-agent-latency
- arXiv 2510.06961, « Open ASR Leaderboard » (jeux de test, octobre 2025) — https://arxiv.org/html/2510.06961v1
- OpenAI, « Robust Speech Recognition via Large-Scale Weak Supervision » (article Whisper, tableau 8) — https://cdn.openai.com/papers/whisper.pdf
- CNIL, « L'enregistrement des conversations téléphoniques afin d'établir la preuve de la formation d'un contrat » — https://www.cnil.fr/fr/lenregistrement-des-conversations-telephoniques-afin-detablir-la-preuve-de-la-formation-dun-contrat
- Règlement (UE) 2016/679 (RGPD), article 28 (sous-traitant) — https://gdpr-info.eu/art-28-gdpr/
- AI Act, article 50 (transparence : informer la personne qu'elle parle à une IA), applicable au 2 août 2026 — https://artificialintelligenceact.eu/article/50/
- Nodical, politique de confidentialité (liste des sous-traitants) — https://nodical.ai/confidentialite
Corrections
Aucune correction à ce jour.