ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.
SaberEntender lo que quiere la persona, sin pasar por el texto
Entender a una persona al teléfono no es escribir lo que dice sino saber lo que quiere; la investigación sabe hacerlo directamente a partir del sonido en reservas de hotel o en órdenes a un asistente, pero nadie ha publicado todavía una medición sobre una llamada saliente de diez segundos, en francés o en español, por una línea telefónica.
Escribir no es entender
Cuando una persona contesta «Uy, no, ahora no me pilla bien», una transcripción perfecta da siete palabras correctas, pero no dice qué hacer: ¿la persona rechaza, o pide que la llamen más tarde? La comprensión del habla —los investigadores dicen SLU, por spoken language understanding— responde a esa pregunta. Busca la intención, es decir, lo que la persona quiere (rechazar, aceptar, que la vuelvan a llamar, hacer una pregunta), y los datos que la acompañan (un día, una hora, un nombre). Para un agente que llama, lo que cuenta es esa decisión, no el texto: un texto perfecto mal interpretado hace tanto daño como uno erróneo.
Dos caminos: por el texto, o directamente del sonido al sentido
El método clásico es una cascada: un reconocimiento de voz escribe lo que oye y luego un segundo modelo lee ese texto y saca la intención. Hereda todos los errores de la primera etapa: al teléfono, donde la transcripción falla mucho más que en un estudio, una palabra mal oída se convierte en una intención mal entendida. Y el texto borra el tono, la duda, la voz que cae.
El otro método va directamente del sonido al sentido, sin transcripción intermedia; se le llama «de extremo a extremo». Los autores de SLURP, un corpus inglés publicado en 2020, escriben que obtiene el sentido «directamente de los datos de audio» y promete reducir la propagación de errores. Los de LeBenchmark 2.0, un proyecto francés, señalan que estos sistemas se prefieren hoy a las cascadas por esa razón, y porque pueden apoyarse en indicios acústicos. Es el camino que ASDIC ha decidido explorar, con una precaución: preferido no quiere decir mejor en todo. La misma elección se plantea para el agente entero, entre una cadena de modelos y un modelo único.
MEDIA, la referencia francesa
En francés, casi todos los trabajos se comparan con MEDIA. Distribuido por ELRA desde 2005 y gratuito para la investigación académica, el equipo que lo actualizó en 2022 lo describe como el más difícil de los que están al alcance de la comunidad. Según el artículo que le añadió once intenciones en 2024, reúne 1.258 diálogos grabados por teléfono, 250 hablantes y unas 70 horas de conversación, sobre un solo tema: la reserva de hotel. Los diálogos se recogieron con el método del «mago de Oz»: la persona cree hablar con una máquina, pero responde un humano oculto.
Sus límites caben en tres palabras: un tema, una época, una puesta en escena. Los datos son de los años 2000, los diálogos son simulados, y una reserva lleva tiempo: 70 horas para 1.258 diálogos dan más de tres minutos por diálogo de media (cálculo nuestro). El inventario completo está en nuestra página sobre los corpus en francés.
Lo que dicen los resultados
El artículo de 2024 compara los dos caminos en MEDIA. Para los datos precisos —fechas, número de habitaciones, precios—, el error es mayor cuando se va directamente del sonido al sentido: el mejor sistema de extremo a extremo falla el 18,30 % de esos datos en la versión completa de la tarea. Para la intención no ocurre lo mismo: el camino directo obtiene las mejores puntuaciones en casi todas las versiones del corpus, y alrededor de 9 de cada 10 intenciones se reconocen bien sea cual sea el camino. Los autores consideran pequeña la diferencia, y la cascada sigue siendo mejor en conjunto cuando se suman las dos tareas. El sonido basta para la intención; el texto sigue siendo útil para el detalle.
Estas cifras no salen de llamadas reales. SLURP, la referencia inglesa, reúne unas 72.000 grabaciones, es decir, 58 horas, de peticiones de un solo turno a un asistente doméstico, leídas en una tableta por más de un centenar de participantes. LeBenchmark 2.0 entrenó sus modelos con hasta 14.000 horas de francés, de las que 38 son diálogos telefónicos, e interpretados.
Una intención en diez segundos no es una intención en tres minutos
En nuestras llamadas de septiembre de 2026, la mitad de las llamadas atendidas por una persona duran diez segundos o menos, y 8 de cada 10 menos de veinte segundos. En diez segundos, una persona dice una o dos frases: «¿Diga?», «¿De parte de quién?», «No, gracias», «Llámeme más tarde». La intención tiene que reconocerse con esas pocas palabras, a menudo en el primer turno. En un diálogo de tres minutos, la persona repite, precisa, corrige; en una llamada de diez segundos no hay segunda oportunidad.
Las intenciones tampoco son las mismas. En MEDIA, la persona llamó para reservar. En una llamada saliente no ha pedido nada, y lo que quiere en el primer turno puede ser simplemente saber quién llama. En cuanto a la intención que más importa a una empresa, «me interesa, quiero hablar con alguien», llega tarde cuando llega: en nuestras llamadas, la transferencia a una persona se produce en el 1,19 % de las llamadas atendidas, a los 135 segundos (mediana). Un modelo que aprendió con reservas de hotel no ha visto ninguna de estas situaciones.
Dónde está ASDIC
Nodical no tiene hoy ningún modelo de comprensión propio: el agente se apoya en el reconocimiento de voz de un proveedor, es decir, en la cascada descrita más arriba. Aún no sabemos con qué frecuencia se equivoca de intención: haría falta un corpus en el que cada turno esté anotado a mano. Es lo que prevé el lote piloto del programa: llamadas reales seudonimizadas, anotadas con la intención en cada turno, las respuestas a las preguntas planteadas y el momento en que una transferencia habría sido pertinente. Nuestro objetivo está escrito como objetivo: más de 9 de cada 10 transferencias juzgadas pertinentes. No está alcanzado; se publicará con la medición, en el cuaderno.
Lo que cambia para una transferencia
En una campaña saliente, la decisión más cara es pasar la llamada a un comercial: demasiado pronto, pierde el tiempo con alguien que no estaba listo; demasiado tarde, la persona interesada ya ha colgado. Esa decisión descansa por completo en la intención. Nodical describe en su web la decisión de transferencia en una campaña saliente.
¿Y en la práctica? la decisión de transferencia en una campaña saliente
Fuentes
consultadas el 1 de octubre de 2026.
- arXiv 2403.19727, Alavoine et al., « New Semantic Task for the French Spoken Language Understanding MEDIA Benchmark » (LREC-COLING 2024) — https://arxiv.org/abs/2403.19727
- Laperrière et al., « The Spoken Language Understanding MEDIA Benchmark Dataset in the Era of Deep Learning » (LREC 2022) — https://aclanthology.org/2022.lrec-1.171/
- arXiv 2309.05472, « LeBenchmark 2.0: a Standardized, Replicable and Enhanced Framework for Self-supervised Representations of French Speech » — https://arxiv.org/abs/2309.05472
- arXiv 2011.13205, Bastianelli et al., « SLURP: A Spoken Language Understanding Resource Package » (EMNLP 2020) — https://arxiv.org/abs/2011.13205
- ASDIC, « Un corpus d'appels téléphoniques en français : pourquoi il n'en existe pas » — https://asdic.ai/savoir/corpus-d-appels-telephoniques-en-francais-pourquoi-il-n-en-existe-pas
- ASDIC, carnet n° 1 : « Septembre 2026 : première mesure » — https://asdic.ai/carnet/2026-09-premiere-mesure
Correcciones
Ninguna corrección hasta la fecha.