ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.
SaberAudio a 8 kHz: lo que los modelos no oyen
Una línea telefónica solo transmite las frecuencias de 300 a 3.400 Hz, comprimidas y a veces con huecos, mientras que los modelos de reconocimiento de voz aprendieron con sonido amplio y limpio; el resultado es que los bancos de pruebas de terceros miden al teléfono entre cinco y seis veces más errores que en lectura.
Lo que deja pasar una línea telefónica
El teléfono se diseñó para que la gente se entienda, no para que se oiga bien. Solo transmite las frecuencias entre 300 y 3.400 hercios aproximadamente, lo que se traduce en un sonido muestreado a 8 kilohercios: la mitad de los 16 kilohercios con los que aprendieron la mayoría de los modelos de reconocimiento de voz, entre cuatro y seis veces menos que una grabación de estudio. Las consonantes agudas, la «s», la «f», la «t», viven por encima de ese límite: al teléfono, «seis» y «tres» se parecen. Se suman la compresión (G.711, ley A en Europa, ley µ en Norteamérica), que reduce cada muestra a ocho bits, y la pérdida de paquetes en redes móviles e IP, que agujerea la señal en trozos de veinte milisegundos.
Por qué un modelo «16 kHz limpio» se desploma
Un modelo aprende lo que se le muestra. Los grandes corpus públicos están hechos de libros leídos, vídeos, habla en banda ancha; el teléfono es raro en ellos, y el teléfono en español o en francés más raro aún. Cuando después se le da un sonido estrecho, comprimido y con huecos, el modelo no tiene malos reflejos: no tiene reflejos. Remuestrea, adivina, y se equivoca sobre todo en lo que importa en una llamada corta: un sí, un no, una cifra, un nombre.
Lo que miden los terceros
Las cifras públicas cuentan la misma historia de un modelo a otro. El artículo que presenta Whisper, el modelo abierto de referencia, da para su modelo más grande un 2,7 % de palabras erróneas en lectura limpia, pero entre un 13,8 y un 17,6 % en los corpus de conversación telefónica en inglés (tabla 8). Para Deepgram Nova-3, una comparativa independiente actualizada en agosto de 2026 registra un 2,6 % en lectura limpia y un 21,8 % en CallHome, un corpus de llamadas telefónicas; su autor resume que «incluso el mejor motor falla más o menos una palabra de cada cinco al teléfono», y espera entre un 18 y un 24 % de errores en conversación a 8 kilohercios. Google, por su parte, ofrece un modelo de transcripción distinto para las llamadas telefónicas, señal de que el caso es aparte. Y Coval, que publica comparativas independientes, recuerda que los bancos de pruebas estándar no reflejan «ni sus guiones, ni sus llamantes, ni sus acentos»: la única medición que cuenta es la hecha con las propias llamadas.
Dos ausencias en todo esto: ninguna de esas cifras está en español, y ninguna en francés. La clasificación pública más usada, el Open ASR Leaderboard, tiene una pista multilingüe pero ninguna pista telefónica.
Lo que cambia para un agente que llama
Una palabra de cada cinco perdida no es una transcripción un poco menos bonita: es una intención perdida, una cita anotada el día equivocado, un «no» tomado por un «sí». Y como nuestras llamadas duran diez segundos (mediana), no hay una segunda oportunidad para recuperarse con el contexto. Por eso ASDIC aprende con audio telefónico desde el principio, en francés, español e inglés, en lugar de adaptar después un modelo de banda ancha.
Dónde está ASDIC
Aún no tenemos una medición de tasa de error de palabras en nuestras llamadas: requiere un corpus transcrito a mano, que es precisamente el lote piloto del programa. Cuando exista, se publicará en el cuaderno, con el método, primero en francés, luego en español e inglés, con sonido a 8 kilohercios tal como llega a la línea. Será, que sepamos, la primera medición pública de este tipo en francés.
Por qué el volumen de llamadas lo cambia todo
Un modelo de telefonía se entrena con llamadas, y nadie tiene tantas como una plataforma que las hace cada día. Nodical explica en su web por qué el volumen de llamadas lo cambia todo para agencias y centros de llamadas.
¿Y en la práctica? por qué el volumen de llamadas lo cambia todo
Fuentes
consultadas el 1 de octubre de 2026.
- OpenAI, « Robust Speech Recognition via Large-Scale Weak Supervision » (article Whisper, tableau 8) — https://cdn.openai.com/papers/whisper.pdf
- Vexascribe, « How accurate is Deepgram? Nova-3 WER benchmarks (2026) » (mis à jour le 25 août 2026) — https://vexascribe.com/how-accurate-is-deepgram
- Google Cloud, « Sélectionner un modèle de transcription » (modèle dédié aux appels téléphoniques) — https://docs.cloud.google.com/speech-to-text/docs/v1/transcription-model?hl=fr
- Deepgram, « Noise-robust speech recognition » — https://deepgram.com/learn/noise-robust-speech-recognition-techniques
- Coval, « Best STT providers 2026: independent benchmarks » (sur la limite des bancs d'essai standard) — https://www.coval.ai/blog/best-speech-to-text-providers-in-2026-independent-benchmarks-and-how-to-choose/
Correcciones
Ninguna corrección hasta la fecha.