par Nodical

ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.

Savoir

Détecter un répondeur en moins de deux secondes : ce qui existe aujourd'hui

Publié le Par Douglas DemartÉtat du projet au 1er octobre 2026

En une phrase

Reconnaître qu'un appel est tombé sur une messagerie prend aujourd'hui plusieurs secondes, parce que les méthodes courantes attendent le bip ou écoutent la cadence de la parole ; sur nos appels de septembre 2026, la décision tombe à 8 secondes en médiane, et notre objectif est de descendre sous 2 secondes.

Pourquoi c'est difficile

Quand une personne décroche, elle dit un mot court — « Allô ? » — puis se tait et attend. Une messagerie fait l'inverse : elle parle longtemps, sans attendre de réponse, puis émet un bip. Sur le papier, la différence est nette. Au téléphone, elle ne l'est pas : l'annonce de la messagerie commence parfois par un silence, parfois par une phrase de l'opérateur, parfois par la voix de la personne elle-même (« Bonjour, vous êtes bien sur le répondeur de… »). Le son est étroit (bande téléphonique, 8 kHz), le début de l'appel est souvent coupé, et l'agent doit décider vite : s'il parle à une messagerie comme à un humain, il perd du temps et de l'argent ; s'il raccroche au nez d'un humain qu'il a pris pour une messagerie, c'est pire.

Le temps compte doublement. Sur nos appels de septembre 2026, la moitié des appels décrochés par un humain durent dix secondes ou moins. Une décision qui arrive à huit secondes arrive donc, pour beaucoup d'appels, après que la conversation a déjà eu lieu.

Les trois façons de reconnaître une messagerie

1. Attendre le bip

La méthode la plus ancienne écoute le signal et cherche la tonalité du bip de fin d'annonce. Elle est fiable quand le bip est net, mais elle ne peut rien dire avant qu'il arrive — c'est-à-dire après toute l'annonce. Elle échoue quand le bip est faible, absent, ou noyé dans le son compressé de la ligne ; Plura détaille ces cas d'échec dans un article que nous citons en bas de page.

2. Écouter la cadence

La deuxième méthode n'écoute pas les mots mais le rythme : combien de temps l'interlocuteur parle, combien de temps il se tait, s'il attend une réponse. Un humain dit quelques mots puis laisse un blanc ; une messagerie enchaîne. C'est le principe des détecteurs intégrés aux opérateurs de téléphonie, et celui du papier publié sur arXiv en avril 2026 (« Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features »), qui montre qu'on peut décider en temps réel à partir de ces seuls indices d'activité de parole. Cette méthode a besoin de quelques secondes d'écoute pour être sûre : trop peu, et un humain bavard ressemble à une messagerie.

3. Transcrire et classer

La troisième méthode transcrit les premiers mots et les classe : « vous êtes bien sur la messagerie de » ne laisse aucun doute, « Allô, oui ? » non plus. Elle est la plus précise quand la transcription est bonne, mais elle dépend de la qualité de la reconnaissance vocale au téléphone, et elle doit attendre d'avoir des mots. Les éditeurs d'agents vocaux récents combinent en général la cadence et la transcription, et laissent le bip comme filet de sécurité.

Ce que publient ceux qui vendent la détection

Twilio, dont la documentation est la plus complète, indique que son détecteur rend son résultat en environ quatre secondes avec les réglages par défaut, et que son délai maximal se règle entre 3 et 59 secondes (30 par défaut). Sa foire aux questions annonce une précision « proche de 100 % » aux États-Unis, et reconnaît qu'elle est moindre à l'international ; aucun chiffre par langue n'est publié. Regal.ai décrit un modèle maison qu'il présente comme meilleur que le marché, mesuré sur ses propres appels nord-américains. Vapi documente plusieurs stratégies au choix de ses clients. Aucune de ces pages ne donne de mesure sur des appels européens, ni ne traite les messageries des opérateurs français ou espagnols.

Où en est ASDIC

Nous ne vendons pas de détecteur ; nous construisons un modèle qui doit décider plus tôt, et nous publions nos mesures telles qu'elles sont. En septembre 2026, sur la base de production de Nodical (60 287 appels décrochés par un humain, 14 campagnes, sans lire le contenu des conversations), le répondeur est reconnu à 8 secondes en médiane, et à 14 secondes pour 9 appels sur 10. C'est trop tard, et c'est précisément ce que le programme 2027-2028 doit changer.

Notre objectif est écrit comme un objectif : moins de 2 secondes, avec moins de 3 % d'erreur. Il n'est pas atteint. Il sera publié avec la mesure qui le prouvera, pas avant. Le détail de la mesure de septembre, sa méthode et ses limites sont dans la première entrée du carnet.

Pourquoi l'Europe est plus dure que les États-Unis

Trois raisons, qui s'additionnent. Les annonces de messagerie sont plus variées : chaque opérateur a les siennes, dans chaque langue, et beaucoup de personnes enregistrent la leur. Les appels sont multilingues : un même modèle doit tenir en français, en espagnol et en anglais, sans qu'on en construise un par langue. Enfin, les mesures publiées ont été faites ailleurs : un détecteur « proche de 100 % » sur des messageries américaines n'a jamais entendu « votre correspondant n'est pas disponible pour le moment ». C'est pour cela que nous mesurons chez nous, et que nous publierons la méthode avec les résultats.

Ce que ça change pour une campagne d'appels

Chaque seconde passée à parler à une messagerie est facturée, et chaque humain raccroché par erreur est un contact perdu. Pour une équipe qui fait appeler un agent vocal, la question « humain ou répondeur » est la première décision de l'appel, et elle conditionne toutes les autres : quand parler, quoi dire, quand transférer. Nodical explique sur son site ce que ça change pour une campagne d'appels.

Et concrètement ? ce que ça change pour une campagne d'appels

Sources

consultées le 1er octobre 2026.

  1. Twilio, « Answering Machine Detection » (documentation) — https://www.twilio.com/docs/voice/answering-machine-detection
  2. Twilio, « AMD FAQ & Best Practices » — https://www.twilio.com/docs/voice/answering-machine-detection-faq-best-practices
  3. arXiv 2604.09675, « Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features » (avril 2026) — https://arxiv.org/html/2604.09675v1
  4. Plura, « Voicemail beep detection: how it works and why it fails » — https://www.plura.ai/articles/voicemail-beep-detection
  5. Regal.ai, « How we built a voicemail detection model » — https://www.regal.ai/blog/how-we-built-an-answering-machine-detection-model-that-outperforms-the-industry
  6. Vapi, « Voicemail detection » (documentation) — https://docs.vapi.ai/calls/voicemail-detection

Corrections

Aucune correction à ce jour.