de Nodical

ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.

Saber

Por qué el reconocimiento de voz falla por teléfono

Publicado el Por Douglas DemartEstado del proyecto a 1 de octubre de 2026

En una frase

Un motor que transcribe casi a la perfección un libro leído falla más o menos una palabra de cada cinco al teléfono, por seis razones que se suman; y en una llamada de diez segundos, una palabra de cada cinco suele ser la que importaba.

La brecha entre el banco de pruebas y la línea

Los proveedores anuncian tasas de error de unos pocos puntos. Son ciertas, con habla leída, limpia, en banda ancha. Al teléfono, los mismos motores fallan mucho más: una comparativa independiente de agosto de 2026 resume que «incluso el mejor motor falla más o menos una palabra de cada cinco» en conversación telefónica, y el propio Deepgram escribe que los centros de llamadas constatan en producción entre un 35 y un 50 % de palabras erróneas, frente al 3 a 5 % de los bancos de pruebas limpios. La brecha no tiene una causa: tiene seis, y se suman.

1. La banda estrecha

La línea solo transmite las frecuencias de 300 a 3.400 hercios, comprimidas a ocho bits. Las consonantes agudas desaparecen, «seis» se parece a «tres». Es la causa de fondo, sobre la que se injertan las demás; tiene su propia página.

2. El ruido

Una calle, un coche, una cocina, una oficina abierta: la persona a la que se llama nunca está en un estudio. Deepgram cita mediciones en las que un fondo de voces («babble») lleva la tasa de error del 5,5 % cuando la voz domina claramente al 15,2 % cuando el ruido es tan fuerte como ella. El ruido cambia de un segundo a otro, y un modelo entrenado con sonido tranquilo no ha aprendido a ignorarlo.

3. Los acentos

Un modelo aprende el acento de sus datos. Un estudio de 2025 evaluó cinco motores con inglés hablado por personas de seis lenguas maternas distintas: todos se degradan entre el habla leída y la espontánea, y ninguno aguanta en todos los acentos a la vez. En español y en francés la cuestión es la misma, y nadie la ha medido al teléfono: un acento andaluz, canario, rioplatense, y el modelo «estándar» solo ha aprendido una parte del idioma.

4. Los solapamientos

Al teléfono, la gente se interrumpe. La persona responde antes del final de la pregunta, el agente retoma antes del final de la respuesta, dos voces se superponen medio segundo. Los motores transcriben una voz cada vez; en un solapamiento, eligen una, mezclan las dos o dejan un hueco. Y en una llamada corta, el solapamiento cae justo sobre el «sí» o el «no» que se esperaba.

5. Los nombres propios

Un apellido, una calle, una empresa, una marca: el modelo no los conoce, así que adivina una palabra corriente que suena parecido. Para un agente que debe anotar con quién ha hablado y adónde devolver la llamada, es la palabra más importante de la llamada, y la que el motor tiene menos probabilidades de acertar.

6. Las cifras

Un número de teléfono, un código postal, una fecha, una hora, un importe. Las cifras son cortas, se dicen deprisa, a menudo en serie, y la banda estrecha las hace sonar todas un poco igual. Una sola cifra errónea en un número de devolución de llamada, y la llamada nunca se hará, sin que nadie lo sepa.

Lo que cuesta en una llamada de diez segundos

En nuestras llamadas de septiembre de 2026, la mitad de las llamadas atendidas duran diez segundos o menos: una veintena de palabras. Una palabra de cada cinco fallada son cuatro o cinco palabras, y no caen al azar: los nombres, las cifras, el «no» dicho sobre el ruido son exactamente las palabras a las que apuntan las seis causas. La transcripción puede parecer correcta y la llamada entenderse al revés.

Dónde está ASDIC

Aún no tenemos una tasa de error medida en nuestras llamadas: hace falta un corpus transcrito a mano, que es el lote piloto del programa. Cuando exista, cada error se clasificará en una de las seis causas, para saber en cuál trabajar primero; aún no sabemos cuál pesa más al teléfono en francés o en español, y preferimos decirlo. Los ejemplos sonoros por causa saldrán de ese mismo corpus, anonimizados, no antes.

Devolver la llamada rápido no sirve de nada si se ha entendido mal

Un agente que devuelve la llamada en un minuto pero anota el nombre o el número equivocado ha perdido el contacto con más seguridad que uno lento. Nodical explica en su web cómo devolver la llamada a un lead en menos de 60 segundos, y lo que hay que haber entendido antes de llamar.

¿Y en la práctica? devolver la llamada rápido no sirve de nada si se ha entendido mal

Fuentes

consultadas el 1 de octubre de 2026.

  1. Deepgram, « Noise-robust speech recognition » (centres d'appels : 35 à 50 % d'erreurs en production contre 3 à 5 % sur les bancs d'essai propres) — https://deepgram.com/learn/noise-robust-speech-recognition-techniques
  2. Vexascribe, « How accurate is Deepgram? » (« même le meilleur moteur rate à peu près un mot sur cinq au téléphone », août 2026) — https://vexascribe.com/how-accurate-is-deepgram
  3. arXiv 2503.06924, « Automatic Speech Recognition for Non-Native English: Accuracy and Disfluency Handling » (mars 2025) — https://arxiv.org/abs/2503.06924
  4. arXiv 2510.06961, « Open ASR Leaderboard » — https://arxiv.org/html/2510.06961v1
  5. ASDIC, « Audio 8 kHz : ce que les modèles n'entendent pas » — https://asdic.ai/savoir/audio-8-khz-ce-que-les-modeles-n-entendent-pas

Correcciones

Ninguna corrección hasta la fecha.