par Nodical

ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.

Savoir

Le silence au téléphone : bruit, respiration, hésitation

Publié le Par Douglas DemartÉtat du projet au 1er octobre 2026

En une phrase

Un détecteur d'activité vocale décide, toutes les quelques dizaines de millisecondes, s'il entend de la parole ou non ; au téléphone, le bruit, la respiration et les hésitations le trompent, et les chiffres les plus cités, ceux de Picovoice sur son propre banc d'essai, portent sur de l'anglais lu et non sur des appels.

Ce que fait un détecteur d'activité vocale

Avant de comprendre ce que dit quelqu'un, un agent vocal doit savoir s'il dit quelque chose. C'est le rôle du détecteur d'activité vocale (VAD, pour voice activity detection) : il découpe le son en tranches de quelques dizaines de millisecondes et rend, pour chacune, une probabilité — parole ou pas parole. Au-dessus d'un seuil, l'agent considère que la personne parle ; en dessous, qu'elle se tait. Tout le reste en dépend : quand transcrire, quand se taire si la personne reprend, quand commencer à compter le silence.

Le détecteur du projet WebRTC, publié en source ouverte par Google, repose sur du traitement du signal classique ; les plus récents sont des réseaux de neurones, comme Silero (ouvert) ou Cobra (vendu par Picovoice).

Ce qui n'est pas du silence

Au téléphone, le « silence » entre deux phrases n'est presque jamais silencieux. Le détecteur doit trancher entre :

  • le bruit : une rue, une voiture, une télévision. Les voix des autres sont le pire : c'est de la parole, mais pas celle de la personne appelée ;
  • la respiration : une inspiration avant de répondre : pas de la parole, mais souvent le signe qu'elle arrive ;
  • l'hésitation : « euh », « bah », « alors… » : de la parole sans mot utile, qui dit pourtant une chose importante — la personne n'a pas fini ;
  • la ligne elle-même : grésillement, écho de la voix de l'agent qui revient par le téléphone de la personne.

Prendre un bruit pour de la parole fait taire l'agent pour rien. Prendre de la parole pour du bruit fait manquer le début d'un « non », ou couper quelqu'un qui reprenait après une hésitation.

Comment on mesure un détecteur

Un détecteur se règle avec un seuil, et chaque seuil donne deux chiffres. Le taux de détection : la part des tranches de parole reconnues comme parole. Le taux de fausses alertes : la part des tranches sans parole prises à tort pour de la parole. Baisser le seuil fait monter les deux. On ne compare donc deux détecteurs qu'à fausses alertes égales, ou sur la courbe qui relie les deux chiffres pour tous les seuils (la courbe ROC). Un pourcentage de « précision » publié seul, sans le taux de fausses alertes qui va avec, ne dit rien.

Ce que publie Picovoice

Picovoice, éditeur canadien de logiciels vocaux qui tournent sur l'appareil, publie le banc d'essai le plus cité sur le sujet. Il faut le lire pour ce qu'il est : le banc d'essai de Picovoice, construit pour comparer son propre produit, Cobra, à deux détecteurs ouverts, celui de WebRTC et Silero (version 5.1). Son code et ses données sont publics, ce qui permet de le rejouer. La méthode : de la parole anglaise lue, tirée de LibriSpeech, un corpus de livres audio enregistré à 16 kHz, mélangée à des bruits réels du corpus DEMAND (18 environnements, dont cuisine, bureau, circulation), avec un rapport signal sur bruit de 0 dB, c'est-à-dire un bruit aussi fort que la voix.

Les résultats, détaillés par Picovoice dans un comparatif publié en novembre 2025 et mis à jour en janvier 2026, se lisent à taux de fausses alertes fixé. Ce sont des taux de détection par tranche de son, pas des taux de réussite par phrase ou par appel :

DétecteurTaux de détection à 5 % de fausses alertesTaux de détection à 1 % de fausses alertes
Cobra (Picovoice)98,9 %95 %
Silero 5.187,7 %80,4 %
WebRTC50 %non publié (taux jugé trop bas par Picovoice)

Banc d'essai de Picovoice : LibriSpeech test-clean (anglais lu, 16 kHz) mélangé au bruit DEMAND à 0 dB. Chiffres publiés par Picovoice, non rejoués par ASDIC.

Picovoice note lui-même que le classement dépend du seuil : à 25 % de fausses alertes, WebRTC fait mieux que Silero. Sa conclusion est la bonne, et elle vaut aussi pour ses propres chiffres : évaluer un détecteur au taux de fausses alertes que son application peut supporter.

Pourquoi ce n'est pas encore le téléphone

Ce banc d'essai mesure une chose réelle, la résistance au bruit, dans des conditions qui ne sont pas celles d'un appel. La parole est lue, pas conversée : pas d'hésitation, pas de « euh », pas de reprise. Elle est en anglais. Elle est en large bande, à 16 kHz, alors que la ligne téléphonique coupe tout au-dessus de 3 400 Hz (voir la page sur l'audio 8 kHz). Le bruit est ajouté après coup, pas capté avec la voix puis compressé par la ligne. Silero, de son côté, accepte le son à 8 kHz comme à 16 kHz, mais ses propres évaluations publiées sont faites à 16 kHz. À notre connaissance, personne n'a publié de comparaison de détecteurs sur de vrais appels téléphoniques, en français ou en espagnol.

Détecter la parole ne dit pas quand répondre

Un détecteur parfait dirait exactement quand la personne parle et quand elle se tait. Il ne dirait toujours pas si elle a fini. « Je voudrais… euh… » suivi d'un silence n'est pas une fin de phrase ; « Non merci. » suivi du même silence en est une. Le banc d'essai eot-bench de LiveKit chiffre ce qu'il en coûte de répondre au seul silence, sur ses données de validation en anglais : après 300 millisecondes de silence, on coupe la parole à tort 55,6 % du temps ; après 600 millisecondes, encore 21,7 % ; et il faut attendre 1,6 seconde pour ne couper qu'une fois sur vingt. Le VAD est le point de départ de la décision de fin de tour, pas la décision elle-même ; c'est l'objet de la page sur la fin de tour de parole.

Où en est ASDIC

Nous n'avons pas de mesure de détection d'activité vocale sur nos appels : il faudrait des appels où chaque passage est marqué à la main — parole, bruit, respiration, hésitation. Ce que nous mesurons aujourd'hui vient après : en septembre 2026, l'agent répond 0,14 seconde en médiane (1,32 seconde pour 9 réponses sur 10) après avoir décidé que la personne avait fini, hors détection de fin de parole. Notre objectif est écrit comme un objectif : répondre en moins de 0,5 seconde, en coupant la parole moins de 5 % du temps. Il n'est pas atteint ; il sera publié avec la mesure qui le prouvera, dans le carnet.

Une ligne qui décroche à toute heure

Une ligne qui répond jour et nuit entend de tout : des appels passés depuis une voiture ou un chantier, des personnes qui cherchent leurs mots. La différence entre silence, bruit et hésitation s'y joue à chaque phrase. Nodical explique sur son site comment ses agents décrochent jour et nuit.

Et concrètement ? comment ses agents décrochent jour et nuit

Sources

consultées le 1er octobre 2026.

  1. Picovoice, « Voice Activity Detection Benchmark » (page officielle du banc d'essai : Cobra, WebRTC VAD, Silero VAD ; courbe ROC) — https://picovoice.ai/docs/benchmark/vad/
  2. Picovoice, dépôt « voice-activity-benchmark » (LibriSpeech test-clean mélangé au bruit DEMAND, courbes tracées à 0 dB de rapport signal sur bruit ; Silero version 5.1) — https://github.com/Picovoice/voice-activity-benchmark
  3. Picovoice, « Choosing the Best Voice Activity Detection in 2026: Cobra vs Silero vs WebRTC VAD » (12 novembre 2025, mis à jour le 23 janvier 2026 ; taux de détection à 5 % et 1 % de fausses alertes) — https://picovoice.ai/blog/best-voice-activity-detection-vad/
  4. Silero VAD, dépôt officiel (licence MIT, 8 000 et 16 000 Hz, moins d'1 ms par tranche de 30 ms et plus sur un seul fil d'exécution du processeur) — https://github.com/snakers4/silero-vad
  5. OpenSLR, LibriSpeech (« environ 1 000 heures d'anglais lu à 16 kHz ») — https://www.openslr.org/12/
  6. LiveKit, eot-bench (classement et jeu de données) — https://github.com/livekit/eot-bench
  7. ASDIC, « Fin de tour de parole : attendre le silence ne suffit pas » — https://asdic.ai/savoir/fin-de-tour-de-parole-attendre-le-silence-ne-suffit-pas

Corrections

Aucune correction à ce jour.