ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.
SaberUn corpus de llamadas en francés: por qué no existe
Todo lo que existe en francés es viejo, o canadiense, o no es audio telefónico, o no está anotado para las decisiones de una llamada; ASDIC construye el suyo a partir de llamadas reales seudonimizadas, y publicará un conjunto de evaluación.
Lo que necesita un agente que llama
Para aprender a decidir durante una llamada, un modelo necesita llamadas: sonido de línea telefónica (8 kilohercios, comprimido), conversaciones reales y cortas, en francés, con dos voces, y sobre todo anotaciones que digan, en cada llamada, qué había que decidir y cuándo: persona o buzón, en qué instante podía saberse, dónde terminan los turnos, qué quería la persona. Ese cuádruple criterio —teléfono, real, francés, anotado para la decisión— es el que hoy no cumple ningún corpus público. En español, la situación no es mejor.
El inventario, sin complacencia
CALLFRIEND French (1996)
El único corpus genuino de llamadas telefónicas en francés distribuido por el Linguistic Data Consortium: 60 conversaciones no guionizadas de 5 a 30 minutos, a 8 kilohercios, entre hablantes nativos de Canadá, realizadas desde Norteamérica. Tiene treinta años, es canadiense y se diseñó para identificar el idioma, no para entender lo que se dice.
ESLO (Orléans)
Las encuestas sociolingüísticas de Orléans son un gran corpus de francés hablado, recogido primero a finales de los años sesenta y de nuevo desde 2008; contiene algunas llamadas telefónicas. El subconjunto telefónico republicado en Hugging Face en 2026 tiene 36 extractos y menos de dos horas, con licencia de investigación no comercial. Valioso para la lingüística; demasiado pequeño, y vetado para uso comercial, para entrenar nada.
Claire (2023)
El Claire French Dialogue Dataset, publicado por LINAGORA, reúne unos 160 millones de palabras de diálogos en francés procedentes de 24 corpus: transcripciones y obras de teatro. Es texto, no sonido; enseña a un modelo de lenguaje cómo se habla la gente, no cómo se oye al teléfono. Licencia no comercial.
MEDIA (2005)
Distribuido por ELRA desde 2005 y durante mucho tiempo la referencia francesa en comprensión del habla, MEDIA se compone de diálogos de reserva turística grabados en laboratorio a principios de los 2000, anotados en conceptos (y, desde 2024, en intenciones). Gratuito para la investigación desde 2020. Veinte años, un solo dominio, diálogos simulados: útil para comparar modelos, no para aprender una llamada saliente de 2026.
El banco de pruebas de Luqia (2026)
En septiembre de 2026, Luqia Technologies publicó el primer banco de pruebas de diálogo «full-duplex» en francés (pausas, turnos, interrupciones, asentimientos), en dos variantes: canadiense, construida sobre CALLFRIEND, y europea, construida sobre MEDIA. Un trabajo serio, que hay que citar, y que, por construcción, descansa sobre los dos corpus anteriores, con sus límites.
Y las clasificaciones públicas
La clasificación más usada en reconocimiento de voz, el Open ASR Leaderboard, evalúa el francés y el español con CoVoST-2 y FLEURS: habla leída, en banda ancha. No tiene pista telefónica en ningún idioma.
Por qué nadie lo ha hecho
Porque un corpus de llamadas reales es difícil de constituir legalmente y caro de anotar. Hay que tener derecho a grabar, decírselo a las personas, retirar lo que las identifica y hacer escuchar miles de llamadas a anotadores. Los laboratorios no tienen las llamadas; las empresas que las tienen no publican. ASDIC está en el punto de encuentro: Nodical hace las llamadas, y el programa de investigación tiene por misión convertirlas en datos publicables.
Lo que construimos
Un corpus de llamadas salientes reales, primero en francés, luego en español e inglés, a 8 kilohercios tal como llega el sonido a la línea, seudonimizado antes de cualquier anotación: nombres, números y direcciones retirados del audio y de las transcripciones. Las anotaciones apuntan a las decisiones de la llamada: persona o buzón con el instante en que es reconocible, intención en cada turno, respuestas a las preguntas, límites y finales de turno, momento en que una transferencia habría sido pertinente. Un lote piloto de unas diez horas en 2027, y después entre 300 y 500 horas a lo largo del programa.
Lo que se publicará, y en qué marco
El corpus de entrenamiento no se publicará: contiene conversaciones reales, y la seudonimización no basta para convertirlo en dato público. Lo que publicaremos: un conjunto de evaluación anonimizado y reducido, para que cualquiera pueda probar sus modelos con audio telefónico en francés y comparar; los resultados de los modelos abiertos en ese conjunto; y el método, en el cuaderno. El marco es el de las recomendaciones de la CNIL para el desarrollo de sistemas de IA: reutilización basada en el interés legítimo, información a las personas al inicio de la llamada, derecho de oposición, evaluación de impacto revisada por un asesor jurídico antes del primer entrenamiento. Mientras ese marco no esté validado, no se publica nada.
Quién construye ASDIC
ASDIC es el programa de investigación de Nodical, que hace llamar a agentes de voz cada día por cuenta de empresas. Nodical se presenta en su web: quién construye ASDIC.
¿Y en la práctica? quién construye ASDIC
Fuentes
consultadas el 1 de octubre de 2026.
- LDC, CALLFRIEND Canadian French (LDC96S48, 1996) — https://catalog.ldc.upenn.edu/LDC96S48
- Hugging Face, BrunoHays/eslo-telephony-fr (sous-ensemble téléphonique d'ESLO 1) — https://huggingface.co/datasets/BrunoHays/eslo-telephony-fr
- arXiv 2311.16840, « The Claire French Dialogue Dataset » (LINAGORA Labs, 2023) — https://arxiv.org/abs/2311.16840
- arXiv 2403.19727, MEDIA : nouvelle annotation en intentions (ELRA, distribué depuis 2005) — https://arxiv.org/abs/2403.19727
- arXiv 2609.10765, Luqia, « French Full-Duplex Benchmark » (EMNLP 2026 Industry) — https://arxiv.org/abs/2609.10765
- arXiv 2510.06961, « Open ASR Leaderboard » (pistes et jeux de données) — https://arxiv.org/html/2510.06961v1
- CNIL, recommandations pour le développement des systèmes d'IA (corpus de fiches, 2025) — https://www.cnil.fr/fr/intelligence-artificielle/recommandations-developpement-systemes-ia
Correcciones
Ninguna corrección hasta la fecha.