ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.
SaberEl español al teléfono: acentos, velocidad y «¿diga?»
Un agente de voz que llama en español tiene que entender «¿Diga?», «¿Bueno?» y «¿Aló?», un acento de Madrid, de Canarias o de Buenos Aires y un habla rápida, mientras que las clasificaciones públicas solo evalúan español leído, nunca al teléfono; y como las primeras llamadas en español de Nodical aún no han tenido lugar, ASDIC no publica todavía ninguna cifra en español.
El primer segundo ya cambia de un país a otro
En Francia se descuelga con «Allô ?». En España, con «¿Diga?», «¿Dígame?» o un simple «¿Sí?». El Diccionario de la lengua española recoge «diga» y «dígame» como expresiones que se usan «cuando se responde al teléfono», marca «¿bueno?» como mexicano y «aló» como americano, con un detalle curioso: viene del francés allô. Palabras distintas con la misma forma: una palabra corta, una pregunta, y silencio. Es lo que distingue a una persona de un contestador, que habla largo sin esperar respuesta.
El problema, para una máquina, es lo que la palabra significa en cada país. «Bueno» también quiere decir «de acuerdo»: un «¿Bueno?» al descolgar en México no es un sí. Y en México, según el Catálogo de voces hispánicas del Instituto Cervantes, «¿mande?» significa «¿cómo dice?»: una petición de repetir, no una respuesta.
Un idioma, muchos acentos
Unos 520 millones de personas tienen el español como lengua nativa, según el Instituto Cervantes (2025), y no lo pronuncian igual. El Catálogo de voces hispánicas describe las diferencias ciudad por ciudad; algunas caen justo donde una máquina las nota:
- Madrid distingue la s de la z («casa» y «caza» suenan distinto) y tiende a aspirar la s final de sílaba.
- Las Palmas de Gran Canaria sesea (las dos suenan igual), aspira o pierde la s final («mesas» suena casi «mesah») y su entonación tiene coincidencias con la caribeña.
- Buenos Aires sesea, tiende a aspirar la s final y usa el voseo («vos tenés»).
- Ciudad de México sesea, pero mantiene las s finales tensas y largas y debilita las vocales átonas («antes» suena casi «ants»).
La s final es tan reveladora que el Linguistic Data Consortium la usó para separar a los hablantes «caribeños» y «no caribeños» de sus corpus telefónicos en español. Y a menudo lleva el plural: «las mesas» frente a «la mesa». Reducida a un soplo y pasada por una línea estrecha (véase la página sobre el audio a 8 kHz), pensamos que se oye aún peor; es una hipótesis que todavía no hemos medido.
La velocidad: más sílabas, no más información
Un estudio del CNRS y de la Universidad Lumière Lyon 2, publicado en Science Advances en 2019, comparó 17 idiomas, el español y el francés entre ellos, con 15 textos cortos leídos por 10 hablantes nativos por idioma. El español aparece como ejemplo de idioma que se habla deprisa, con poca información por sílaba; al final, todos los idiomas estudiados transmiten unos 39 bits de información por segundo. Hablar rápido no es decir más.
Para una máquina, en cambio, algo cambia: más sílabas que separar en el mismo tiempo, en un sonido ya estrecho, y la decisión de fin de turno que tomar a un ritmo más rápido. Pero el estudio mide textos leídos: no conocemos ninguna medición publicada de la velocidad del español al teléfono.
Lo que evalúan las clasificaciones públicas en español
La clasificación pública más usada en reconocimiento de voz, el Open ASR Leaderboard, evalúa el español en su pista multilingüe. El artículo que la presenta (octubre de 2025) cita CoVoST-2 (frases leídas), FLEURS (frases de Wikipedia leídas, en 102 idiomas) y MLS (audiolibros de LibriVox); su conjunto de datos actual, actualizado en julio de 2026, contiene para el español FLEURS, Common Voice y MLS. Siempre habla leída, en banda ancha.
En ese terreno, al español le va bien: en la tabla multilingüe del artículo, cinco modelos (Canary, Whisper, Phi-4, Parakeet y Voxtral) fallan de media entre un 3,2 y un 3,8 % de las palabras en español, y para cada uno de ellos es, de los cinco idiomas evaluados, el que tiene menos errores. Buena noticia para el español leído. Nada dice del español al teléfono.
Lo que no evalúan: el teléfono
La clasificación no tiene pista telefónica, en ningún idioma, y los conjuntos privados que añadió en mayo de 2026 son solo en inglés. Sin embargo, a diferencia del francés, el español sí tiene audio telefónico de investigación, distribuido por el LDC: CALLHOME Spanish (unas 38 horas, 120 conversaciones a 8 kHz, sobre todo con familiares o amigos), Fisher Spanish (unas 163 horas, 819 conversaciones de 10 a 12 minutos entre 136 hablantes caribeños y no caribeños) y dos CALLFRIEND de 60 conversaciones cada uno.
Son corpus serios, pero ninguno se parece a una llamada comercial de diez segundos: son conversaciones largas, grabadas desde América (Estados Unidos, Canadá, Puerto Rico, República Dominicana), publicadas entre 1996 y 2010, y ninguna clasificación pública las usa. El banco de pruebas eot-bench de LiveKit incluye el español entre sus 14 idiomas de conversaciones reales entre una persona y un agente, pero no dice nada de la telefonía. En francés, la situación es aún peor, como contamos en la página sobre el corpus de llamadas en francés.
Dónde está ASDIC en español
En español, ASDIC no tiene ninguna cifra: las primeras llamadas en español de Nodical aún no han tenido lugar. Las mediciones publicadas en el cuaderno se hicieron con llamadas en francés, y no las trasladamos. Cuando arranquen las primeras campañas en español, mediremos lo mismo que en francés (contestador, fin de turno, cortes, transferencias, duración), por país y por acento, con el sonido a 8 kHz tal como llega a la línea. Los objetivos del programa valen para el francés, el español y el inglés; no están alcanzados en ningún idioma y se publicarán con la medición que los demuestre.
Lo que cambia para una campaña en España
Un agente que llama a España no debe sonar como si llamara a México, ni tomar un «¿Bueno?» por un sí, ni perder el plural de quien aspira las eses. Nodical explica en su web cómo funciona una campaña de prospección saliente, de la cualificación a la transferencia en caliente.
¿Y en la práctica? cómo funciona una campaña de prospección saliente
Fuentes
consultadas el 1 de octubre de 2026.
- RAE-ASALE, Diccionario de la lengua española, « aló » (« interj. Am. U. para responder al teléfono », du français allô) — https://dle.rae.es/al%C3%B3
- RAE-ASALE, Diccionario de la lengua española, « bueno » (« interj. Méx. U. para contestar al teléfono ») — https://dle.rae.es/bueno
- RAE-ASALE, Diccionario de la lengua española, « decir » (« diga, o dígame : exprs. U. cuando se responde al teléfono ») — https://dle.rae.es/decir
- Instituto Cervantes, Catálogo de voces hispánicas, Madrid — https://cvc.cervantes.es/lengua/voces_hispanicas/espana/madrid.htm
- Instituto Cervantes, Catálogo de voces hispánicas, Las Palmas de Gran Canaria — https://cvc.cervantes.es/lengua/voces_hispanicas/espana/las_palmas.htm
- Instituto Cervantes, Catálogo de voces hispánicas, Buenos Aires — https://cvc.cervantes.es/lengua/voces_hispanicas/argentina/buenosaires.htm
- Instituto Cervantes, Catálogo de voces hispánicas, Ciudad de México — https://cvc.cervantes.es/lengua/voces_hispanicas/mexico/mexicodf.htm
- Instituto Cervantes, « El español: lengua para el mundo 2025 », 20 claves (520 millions de locuteurs natifs) — https://cvc.cervantes.es/lengua/anuario/anuario_25/elm/p01.htm
- CNRS, « Similar information rates across languages, despite divergent speech rates » (communiqué, septembre 2019) — https://www.cnrs.fr/en/press/similar-information-rates-across-languages-despite-divergent-speech-rates
- Coupé, Oh, Dediu, Pellegrino, « Different languages, similar encoding efficiency », Science Advances, 4 septembre 2019 — https://doi.org/10.1126/sciadv.aaw2594
- arXiv 2510.06961, « Open ASR Leaderboard » (tableau 1 : jeux de données ; tableau 4 : erreurs par langue) — https://arxiv.org/html/2510.06961v1
- Open ASR Leaderboard, dépôt GitHub (jeux multilingues actuels : FLEURS, Common Voice, MLS) — https://github.com/huggingface/open_asr_leaderboard
- Hugging Face, « Open ASR Leaderboard: private data » (6 mai 2026, jeux privés en anglais seulement) — https://huggingface.co/blog/open-asr-leaderboard-private-data
- arXiv 2205.12446, « FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech » — https://arxiv.org/abs/2205.12446
- arXiv 2012.03411, « MLS: A Large-Scale Multilingual Dataset for Speech Research » — https://arxiv.org/abs/2012.03411
- LDC, CALLHOME Spanish Speech (LDC96S35) — https://catalog.ldc.upenn.edu/LDC96S35
- LDC, Fisher Spanish Speech (LDC2010S01) — https://catalog.ldc.upenn.edu/LDC2010S01
- LDC, CALLFRIEND Spanish-Caribbean Dialect (LDC96S57) — https://catalog.ldc.upenn.edu/LDC96S57
- LDC, CALLFRIEND Spanish-Non-Caribbean Dialect (LDC96S58) — https://catalog.ldc.upenn.edu/LDC96S58
- LiveKit, eot-bench (14 langues, dont l'espagnol) — https://github.com/livekit/eot-bench
- ASDIC, carnet n° 1 : « Septembre 2026 : première mesure » — https://asdic.ai/carnet/2026-09-premiere-mesure
Correcciones
Ninguna corrección hasta la fecha.