ASDIC est un projet de recherche 2027-2028. Les mesures publiées sont celles du carnet ; les objectifs sont des objectifs.
SavoirUn corpus d'appels téléphoniques en français : pourquoi il n'en existe pas
Tout ce qui existe en français est soit vieux, soit canadien, soit pas du téléphone, soit pas annoté pour les décisions d'un appel ; ASDIC constitue le sien à partir d'appels réels pseudonymisés, et en publiera un jeu d'évaluation.
Ce dont un agent qui appelle a besoin
Pour apprendre à décider pendant un appel, un modèle a besoin d'appels : du son de ligne téléphonique (8 kilohertz, compressé), des conversations réelles et courtes, en français, avec deux voix — et surtout des annotations qui disent, pour chaque appel, ce qu'il fallait décider et quand : humain ou messagerie, à quel instant on pouvait le savoir, où finissent les tours de parole, ce que voulait la personne. Ce quadruple critère — téléphone, réel, français, annoté pour la décision — est ce qu'aucun corpus public ne remplit aujourd'hui.
L'inventaire, sans complaisance
CALLFRIEND French (1996)
Le seul vrai corpus d'appels téléphoniques en français distribué par le Linguistic Data Consortium : 60 conversations non scriptées de 5 à 30 minutes, à 8 kilohertz, entre locuteurs natifs du Canada, passées depuis l'Amérique du Nord. Il a trente ans, il est canadien, et il a été conçu pour l'identification de la langue, pas pour comprendre ce qui se dit.
ESLO (Orléans)
Les Enquêtes sociolinguistiques à Orléans sont un grand corpus de français parlé, collecté d'abord à la fin des années 1960 puis à nouveau depuis 2008 ; il contient quelques appels téléphoniques. Le sous-ensemble téléphonique republié sur Hugging Face en 2026 fait 36 extraits et moins de deux heures, sous licence de recherche, non commerciale. Précieux pour la linguistique ; trop petit, et interdit d'usage commercial, pour entraîner quoi que ce soit.
Claire (2023)
Le Claire French Dialogue Dataset, publié par LINAGORA, rassemble environ 160 millions de mots de dialogues en français tirés de 24 corpus : transcriptions et pièces de théâtre. C'est du texte, pas du son ; il apprend à un modèle de langue comment on se parle, pas comment on s'entend au téléphone. Licence non commerciale.
MEDIA (2005)
Distribué par ELRA depuis 2005 et longtemps la référence française pour la compréhension de la parole, MEDIA est fait de dialogues de réservation touristique enregistrés en laboratoire au début des années 2000, annotés en concepts (et, depuis 2024, en intentions). Gratuit pour la recherche depuis 2020. Vingt ans, un seul domaine, des dialogues simulés : utile pour comparer des modèles, pas pour apprendre un appel sortant de 2026.
Le benchmark de Luqia (2026)
En septembre 2026, Luqia Technologies a publié le premier banc d'essai de dialogue « full-duplex » en français (pauses, tours de parole, interruptions, acquiescements), en deux variantes : canadienne, construite sur CALLFRIEND, et européenne, construite sur MEDIA. Un travail sérieux, à citer — et qui, par construction, repose sur les deux corpus ci-dessus, avec leurs limites.
Et les classements publics
Le classement le plus utilisé pour la reconnaissance vocale, l'Open ASR Leaderboard, évalue le français sur CoVoST-2 et FLEURS : de la parole lue, en large bande. Il n'a pas de piste téléphone, dans aucune langue.
Pourquoi personne ne l'a fait
Parce qu'un corpus d'appels réels est difficile à constituer légalement et coûteux à annoter. Il faut avoir le droit d'enregistrer, le dire aux personnes, retirer ce qui les identifie, et faire écouter des milliers d'appels à des annotateurs. Les laboratoires n'ont pas les appels ; les entreprises qui les ont ne publient pas. ASDIC est au point de rencontre : Nodical passe les appels, et le programme de recherche a pour mission de les transformer en données publiables.
Ce que nous construisons
Un corpus d'appels sortants réels, en français d'abord, puis en espagnol et en anglais, à 8 kilohertz tel que le son arrive sur la ligne, pseudonymisé avant toute annotation : noms, numéros et adresses retirés de l'audio et des transcriptions. Les annotations visent les décisions de l'appel : humain ou messagerie avec l'instant où c'est reconnaissable, intention à chaque tour, réponses aux questions posées, frontières et fins de tours, moment où un transfert aurait été pertinent. Un lot pilote d'une dizaine d'heures en 2027, puis 300 à 500 heures sur la durée du programme.
Ce qui sera publié, et dans quel cadre
Le corpus d'entraînement ne sera pas publié : il contient des conversations réelles, et la pseudonymisation ne suffit pas à en faire une donnée publique. Ce que nous publierons : un jeu d'évaluation anonymisé et réduit, pour que n'importe qui puisse rejouer ses modèles sur du téléphone français et comparer ; les résultats des modèles ouverts sur ce jeu ; et la méthode, dans le carnet. Le cadre est celui des recommandations de la CNIL pour le développement des systèmes d'IA : réutilisation fondée sur l'intérêt légitime, information des personnes en début d'appel, droit d'opposition, analyse d'impact relue par un conseil juridique avant le premier entraînement. Tant que ce cadre n'est pas validé, rien n'est publié.
Qui construit ASDIC
ASDIC est le programme de recherche de Nodical, qui fait appeler des agents vocaux chaque jour pour le compte d'entreprises. Nodical se présente sur son site : qui construit ASDIC.
Et concrètement ? qui construit ASDIC
Sources
consultées le 1er octobre 2026.
- LDC, CALLFRIEND Canadian French (LDC96S48, 1996) — https://catalog.ldc.upenn.edu/LDC96S48
- Hugging Face, BrunoHays/eslo-telephony-fr (sous-ensemble téléphonique d'ESLO 1) — https://huggingface.co/datasets/BrunoHays/eslo-telephony-fr
- arXiv 2311.16840, « The Claire French Dialogue Dataset » (LINAGORA Labs, 2023) — https://arxiv.org/abs/2311.16840
- arXiv 2403.19727, MEDIA : nouvelle annotation en intentions (ELRA, distribué depuis 2005) — https://arxiv.org/abs/2403.19727
- arXiv 2609.10765, Luqia, « French Full-Duplex Benchmark » (EMNLP 2026 Industry) — https://arxiv.org/abs/2609.10765
- arXiv 2510.06961, « Open ASR Leaderboard » (pistes et jeux de données) — https://arxiv.org/html/2510.06961v1
- CNIL, recommandations pour le développement des systèmes d'IA (corpus de fiches, 2025) — https://www.cnil.fr/fr/intelligence-artificielle/recommandations-developpement-systemes-ia
Corrections
Aucune correction à ce jour.