par Nodical

ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.

Savoir

Mesurer un agent vocal : les cinq chiffres qui comptent

Publié le Par Douglas DemartÉtat du projet au 1er octobre 2026

En une phrase

Les comparatifs d'agents vocaux mesurent presque tous une seule chose, le temps avant le premier son, alors qu'un appel sortant se joue sur cinq décisions ; nous publions ces cinq mesures, en médiane et pour 9 appels sur 10, à partir de nos propres appels.

Ce que mesurent les comparatifs, et pourquoi ça ne suffit pas

Quand on compare des agents vocaux, on mesure presque toujours la latence : le temps entre le moment où la personne se tait et celui où l'agent commence à parler. Le banc d'essai le plus sérieux que nous connaissions, OpenBenchmarks, l'appelle TTFAB (time to first audio byte) et le mesure proprement, sur de vrais appels téléphoniques, avec un enregistrement des deux côtés sur la même horloge. Ses relevés d'août 2026 donnent, pour cinq plateformes du marché, des médianes entre 1,3 et 1,7 seconde et des p95 entre 1,8 et 2,3 secondes. C'est utile, et c'est à créditer. Mais c'est un seul chiffre, et il ne dit pas si l'agent a reconnu un répondeur, s'il a coupé la parole, s'il a transféré au bon moment ni s'il a compris quoi que ce soit. Un agent peut répondre vite et faire n'importe quoi.

Les cinq chiffres que nous publions

1. Le délai pour savoir à qui l'on parle

Combien de temps après le décroché l'agent sait qu'il parle à un humain ou à une messagerie. C'est la première décision de l'appel, et elle conditionne toutes les autres. Aujourd'hui : 8 secondes en médiane, 14 secondes pour 9 appels sur 10. Objectif : moins de 2 secondes.

2. Le délai de fin de tour

Combien de temps entre le dernier mot de la personne et le premier mot de l'agent — la vraie attente, celle qu'on perçoit. C'est le chiffre qui ressemble le plus à la « latence » des comparatifs, à une différence près : il doit inclure la décision que la phrase est finie, pas seulement la fabrication de la réponse. Aujourd'hui nous ne mesurons que la seconde partie (0,14 seconde en médiane, 1,32 seconde pour 9 réponses sur 10) ; la mesure complète demande un corpus annoté. Objectif : moins de 0,5 seconde.

3. Le taux de coupure

La part des tours de parole où l'agent a parlé alors que la personne n'avait pas fini. Ce chiffre va de pair avec le précédent : on peut toujours répondre plus vite en coupant plus souvent. Le banc d'essai eot-bench de LiveKit montre l'ampleur du compromis pour un détecteur qui n'écoute que le silence : 55,6 % de coupures à tort en répondant après 300 millisecondes, 21,7 % après 600, sur ses données en anglais. Nous ne l'avons pas encore mesuré sur nos appels. Objectif : moins de 5 %.

4. Le taux de transfert à tort

Quand l'agent passe l'appel à un humain, était-ce le bon moment ? Un transfert trop tôt gaspille un conseiller ; trop tard, la personne a raccroché. Aujourd'hui : 1,19 % des appels décrochés sont transférés, à 135 secondes en médiane ; nous ne savons pas encore quelle part de ces transferts était pertinente. Objectif : plus de 9 transferts sur 10 jugés pertinents.

5. La durée d'appel

Le chiffre le plus simple, et le plus oublié. Il donne l'échelle de tous les autres : sur nos appels de septembre 2026, la moitié des appels décrochés durent 10 secondes ou moins, et 8 sur 10 moins de 20 secondes. Une décision qui arrive à 8 secondes arrive, pour beaucoup d'appels, après la fin de la conversation.

Comment lire une médiane et un p90

Nous ne publions jamais de moyenne : quelques appels très longs la faussent. La médiane est la valeur qui partage les appels en deux moitiés : la moitié font mieux, la moitié font moins bien. Le p90 est la valeur sous laquelle se trouvent 9 appels sur 10 ; c'est lui qui décrit l'expérience des personnes qui ont attendu le plus. Un agent peut avoir une bonne médiane et un mauvais p90 : il est rapide en général et parfois très lent, ce qui, au téléphone, se remarque. Les bancs d'essai sérieux publient les deux ; les pages commerciales ne publient en général que la meilleure.

Ce que nous ne mesurons pas encore

Sur ces cinq chiffres, deux sont mesurés aujourd'hui (le délai humain-ou-répondeur, la durée), un l'est à moitié (le délai de fin de tour, hors décision), et deux attendent un corpus annoté à la main (coupures, pertinence des transferts). Le carnet dit à chaque entrée lequel a avancé. Nous préférons publier « pas encore mesuré » qu'un chiffre repris d'ailleurs.

Ce que Nodical fait de ces mesures

Ces cinq chiffres sont ceux qu'un client regarde, qu'il le sache ou non : un appel trop long coûte, une coupure fait raccrocher, un transfert raté perd un contact. Nodical explique sur son site ce qu'il fait de ces mesures dans ses campagnes.

Et concrètement ? ce que Nodical fait de ces mesures

Sources

consultées le 1er octobre 2026.

  1. OpenBenchmarks, « Voice agent latency benchmark (2026), TTFAB from real phone calls » (dernier appel : 1er août 2026) — https://openbenchmarks.com/voice-agent-latency
  2. LiveKit, eot-bench (classement et jeu de données) — https://github.com/livekit/eot-bench
  3. Hamming.ai, « Voice AI latency: what's fast, what's slow » — https://hamming.ai/resources/voice-ai-latency-whats-fast-whats-slow-how-to-fix-it
  4. Telnyx, « Voice AI agents compared on latency » — https://telnyx.com/resources/voice-ai-agents-compared-latency
  5. ASDIC, carnet n° 1 : « Septembre 2026 : première mesure » — https://asdic.ai/carnet/2026-09-premiere-mesure

Corrections

Aucune correction à ce jour.