par Nodical

ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.

Savoir

Comprendre ce que la personne veut, sans passer par le texte

Publié le Par Douglas DemartÉtat du projet au 1er octobre 2026

En une phrase

Comprendre une personne au téléphone, ce n'est pas écrire ce qu'elle dit mais savoir ce qu'elle veut ; la recherche sait le faire directement à partir du son sur des réservations d'hôtel ou des commandes à un assistant, mais personne n'a encore publié de mesure sur un appel sortant de dix secondes, en français, sur une ligne téléphonique.

Écrire n'est pas comprendre

Quand une personne répond « Ah non, là, c'est pas le moment », une transcription parfaite donne sept mots justes, mais ne dit pas quoi faire : la personne refuse-t-elle, ou demande-t-elle qu'on la rappelle ? La compréhension de la parole — les chercheurs disent SLU, pour spoken language understanding — répond à cette question. Elle cherche l'intention, c'est-à-dire ce que la personne veut (refuser, accepter, être rappelée, poser une question), et les informations qui l'accompagnent (un jour, une heure, un nom). Pour un agent qui appelle, c'est cette décision qui compte, pas le texte : un texte parfait mal interprété fait autant de dégâts qu'un texte faux.

Deux chemins : par le texte, ou directement du son au sens

La méthode classique est une cascade : une reconnaissance vocale écrit ce qu'elle entend, puis un second modèle lit ce texte et en tire l'intention. Elle hérite de toutes les erreurs de la première étape : au téléphone, où la transcription se trompe beaucoup plus qu'en studio, un mot mal entendu devient une intention mal comprise. Et le texte efface le ton, l'hésitation, la voix qui retombe.

L'autre méthode va directement du son au sens, sans transcription intermédiaire ; on dit « de bout en bout ». Les auteurs de SLURP, un corpus anglais publié en 2020, écrivent qu'elle tire le sens « directement des données audio » et promet de réduire la propagation des erreurs. Ceux de LeBenchmark 2.0, un projet français, notent que ces systèmes sont désormais préférés aux cascades pour cette raison, et parce qu'ils peuvent s'appuyer sur des indices acoustiques. C'est le chemin qu'ASDIC a choisi d'explorer, avec une précaution : préféré ne veut pas dire meilleur partout. Le même choix se pose pour l'agent tout entier, entre une chaîne de modèles et un modèle unique.

MEDIA, la référence française

En français, presque tous les travaux se comparent sur MEDIA. Distribué par ELRA depuis 2005 et gratuit pour la recherche académique, ce corpus est décrit par l'équipe qui l'a mis à jour en 2022 comme le plus difficile de ceux accessibles à la communauté. Selon l'article qui lui a ajouté onze intentions en 2024, il réunit 1 258 dialogues enregistrés au téléphone, 250 locuteurs et environ 70 heures de conversation, sur un seul sujet : la réservation d'hôtel. Les dialogues ont été recueillis selon la méthode du « magicien d'Oz » : la personne croit parler à une machine, mais c'est un humain caché qui répond.

Ses limites tiennent en trois mots : un sujet, une époque, une mise en scène. Les données datent des années 2000, les dialogues sont simulés, et une réservation prend du temps : 70 heures pour 1 258 dialogues, cela fait plus de trois minutes par dialogue en moyenne (notre calcul). L'inventaire complet est sur notre page consacrée aux corpus en français.

Ce que disent les résultats

L'article de 2024 compare les deux chemins sur MEDIA. Pour les informations précises — dates, nombre de chambres, prix —, l'erreur est plus élevée quand on va directement du son au sens : le meilleur système de bout en bout se trompe sur 18,30 % de ces informations dans la version complète de la tâche. Pour l'intention, ce n'est pas le cas : le chemin direct obtient les meilleurs scores sur presque toutes les versions du corpus, et environ 9 intentions sur 10 sont bien reconnues quel que soit le chemin. Les auteurs jugent l'écart faible, et la cascade reste globalement meilleure quand on additionne les deux tâches. Le son suffit pour l'intention ; le texte reste utile pour le détail.

Ces chiffres ne viennent pas d'appels réels. SLURP, la référence anglaise, rassemble environ 72 000 enregistrements, soit 58 heures, de demandes d'un seul tour adressées à un assistant domestique, lues sur une tablette par plus d'une centaine de participants. LeBenchmark 2.0 a entraîné ses modèles sur jusqu'à 14 000 heures de français, dont 38 heures de dialogues téléphoniques, et ce sont des dialogues joués.

Une intention en dix secondes n'est pas une intention en trois minutes

Sur nos appels de septembre 2026, la moitié des appels décrochés par un humain durent dix secondes ou moins, et 8 sur 10 moins de vingt secondes. En dix secondes, une personne dit une ou deux phrases : « Oui ? », « C'est pour quoi ? », « Non merci », « Rappelez-moi plus tard ». L'intention doit être reconnue sur ces quelques mots, souvent au premier tour. Dans un dialogue de trois minutes, la personne répète, précise, corrige ; dans un appel de dix secondes, il n'y a pas de deuxième chance.

Les intentions ne sont pas les mêmes non plus. Dans MEDIA, la personne a appelé pour réserver. Dans un appel sortant, elle n'a rien demandé, et ce qu'elle veut au premier tour peut être simplement savoir qui appelle. Quant à l'intention qui compte le plus pour une entreprise, « ça m'intéresse, je veux parler à quelqu'un », elle arrive tard quand elle arrive : sur nos appels, le transfert vers un humain concerne 1,19 % des appels décrochés, à 135 secondes en médiane. Un modèle qui a appris sur des réservations d'hôtel n'a vu aucune de ces situations.

Où en est ASDIC

Nodical n'a aujourd'hui aucun modèle de compréhension qui lui soit propre : l'agent s'appuie sur la reconnaissance vocale d'un prestataire, donc sur la cascade décrite plus haut. Nous ne savons pas encore à quelle fréquence il se trompe d'intention : il faudrait un corpus où chaque tour est annoté à la main. C'est ce que prévoit le lot pilote du programme : des appels réels pseudonymisés, annotés en intention à chaque tour, en réponses aux questions posées, et avec le moment où un transfert aurait été pertinent. Notre objectif est écrit comme un objectif : plus de 9 transferts sur 10 jugés pertinents. Il n'est pas atteint ; il sera publié avec la mesure, dans le carnet.

Ce que ça change pour un transfert

Dans une campagne sortante, la décision la plus chère est de passer l'appel à un commercial : trop tôt, il perd son temps avec quelqu'un qui n'était pas prêt ; trop tard, la personne intéressée a raccroché. Cette décision repose entièrement sur l'intention. Nodical décrit sur son site la décision de transfert dans une campagne sortante.

Et concrètement ? la décision de transfert dans une campagne sortante

Sources

consultées le 1er octobre 2026.

  1. arXiv 2403.19727, Alavoine et al., « New Semantic Task for the French Spoken Language Understanding MEDIA Benchmark » (LREC-COLING 2024) — https://arxiv.org/abs/2403.19727
  2. Laperrière et al., « The Spoken Language Understanding MEDIA Benchmark Dataset in the Era of Deep Learning » (LREC 2022) — https://aclanthology.org/2022.lrec-1.171/
  3. arXiv 2309.05472, « LeBenchmark 2.0: a Standardized, Replicable and Enhanced Framework for Self-supervised Representations of French Speech » — https://arxiv.org/abs/2309.05472
  4. arXiv 2011.13205, Bastianelli et al., « SLURP: A Spoken Language Understanding Resource Package » (EMNLP 2020) — https://arxiv.org/abs/2011.13205
  5. ASDIC, « Un corpus d'appels téléphoniques en français : pourquoi il n'en existe pas » — https://asdic.ai/savoir/corpus-d-appels-telephoniques-en-francais-pourquoi-il-n-en-existe-pas
  6. ASDIC, carnet n° 1 : « Septembre 2026 : première mesure » — https://asdic.ai/carnet/2026-09-premiere-mesure

Corrections

Aucune correction à ce jour.