de Nodical

ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.

Saber

Leer un benchmark de reconocimiento de voz sin dejarse engañar

Publicado el Por Douglas DemartEstado del proyecto a 1 de octubre de 2026

En una frase

Una tasa de error de palabras solo tiene sentido con tres precisiones —con qué audio, con qué normalización del texto, medida por quién—, y el mismo modelo puede mostrar un 2,7 % con audiolibros leídos y un 17,6 % con llamadas telefónicas sin que ninguna de las dos cifras sea falsa.

Lo que cuenta la tasa de error de palabras

Casi todas las comparativas de reconocimiento de voz dan una sola cifra: la tasa de error de palabras, o WER (word error rate). Se alinea la transcripción de la máquina con una transcripción de referencia, escrita a mano, y se cuentan tres tipos de errores: las sustituciones (una palabra cambiada por otra), las supresiones (una palabra dicha pero ausente) y las inserciones (una palabra escrita pero nunca dicha).

WER = (sustituciones + supresiones + inserciones) ÷ número de palabras de la referencia

Como las inserciones se suman sin límite, la WER puede superar el 100 %: si la persona dice «sí» y la máquina escribe «sí sí eso es», son tres inserciones para una palabra, es decir, un 300 %.

Un ejemplo calculado a mano

La persona dice: «sí estoy libre el jueves a las diez» —8 palabras—. La máquina escribe: «eh sí libre el martes a las diez». Se alinea palabra por palabra:

ReferenciaTranscripciónVeredicto
—ehinserción
sísícorrecta
estoy—supresión
librelibrecorrecta
elelcorrecta
juevesmartessustitución
aacorrecta
laslascorrecta
diezdiezcorrecta

Una sustitución, una supresión, una inserción: 3 errores para 8 palabras, es decir, 3 ÷ 8 = 37,5 %. Los tres no valen lo mismo: «eh» y la falta de «estoy» no cambian nada del sentido, «martes» manda la cita al día equivocado. La WER los cuenta igual.

La normalización, regla del juego que nadie lee

Si se quitan las vacilaciones antes de contar, «eh» desaparece: quedan 2 errores y la WER baja a 2 ÷ 8 = 25 %, sin que la transcripción haya cambiado una letra. Al revés, si la máquina hubiera escrito «10h» en lugar de «diez», un cálculo ingenuo sumaría un error más: 4 ÷ 8 = 50 %, para una hora perfectamente correcta.

Por eso los bancos de pruebas «normalizan» los textos antes de contar. Para el inglés, el Open ASR Leaderboard, la clasificación pública más usada, quita puntuación y mayúsculas, escribe los números con letras, unifica la ortografía y suprime las palabras de vacilación. Esas decisiones pesan: los autores de Whisper escriben que su normalización redujo la WER hasta la mitad en algunos conjuntos de prueba, a menudo por una particularidad de las referencias, y advierten que una normalización puesta a punto con un modelo corre el riesgo de favorecerlo. Vexascribe, que recopila comparativas, lo resume: una comparación de WER solo es válida con el mismo audio y la misma normalización para cada motor.

Lectura frente a conversación

El artículo que presenta Whisper da para su modelo más grande (tabla 8) un 2,7 % de errores con LibriSpeech, audiolibros leídos, pero un 13,8 % con Switchboard y un 17,6 % con CallHome, dos corpus de conversaciones telefónicas en inglés. Lo muestra aún más claro (tabla 2): otro modelo, wav2vec 2.0, tiene la misma puntuación con LibriSpeech, un 2,7 %, pero un 34,8 % con CallHome. Con libros leídos, empate; al teléfono, uno se equivoca el doble que el otro. Los autores concluyen que hay que evaluar fuera de las condiciones de entrenamiento, para no sobrestimar los modelos.

Las clasificaciones públicas heredan esa elección. Según el artículo que lo describe (octubre de 2025), el Open ASR Leaderboard evalúa el español y el francés con tres conjuntos de habla leída —CoVoST-2, FLEURS y MLS— y no tiene ninguna pista dedicada al teléfono. Sus autores lo dicen: ningún modelo gana en todo, ningún conjunto de prueba basta y la WER sola no basta.

16 kHz frente a 8 kHz

LibriSpeech, el conjunto más citado, es habla leída grabada a 16 kilohercios. Una línea telefónica solo transmite las frecuencias de 300 a 3.400 hercios, muestreadas a 8 kilohercios y comprimidas. Para Deepgram Nova-3, Vexascribe registra un 2,6 % de errores con LibriSpeech y un 21,8 % con CallHome, y espera entre un 18 y un 24 % en conversación telefónica a 8 kilohercios: más de ocho veces más errores entre el libro leído y la llamada. Una cifra medida con sonido amplio y limpio no es una cifra de telefonía (vea Audio a 8 kHz: lo que los modelos no oyen y las seis causas de error al teléfono).

Quién midió: el proveedor o un tercero

Un mismo modelo puede llevar tres cifras sin que ninguna sea falsa. Deepgram anuncia para Nova-3 una WER mediana del 5,26 % en transcripción diferida, con un conjunto de prueba que él mismo reunió: 2.703 archivos de audio, nueve dominios, 81,69 horas. Vexascribe registra para el mismo modelo un 2,6 % con LibriSpeech y un 21,8 % con CallHome, y recuerda que una mediana entre conjuntos de prueba oculta los peores dominios. Coval, que vende herramientas de evaluación, añade una trampa: según ella, la WER en tiempo real suele ser de 1 a 3 puntos peor que en diferido con el mismo modelo; una cifra «diferida» no se compara, pues, con una «en tiempo real». La actitud correcta no es la desconfianza, sino la pregunta.

Lo que oculta una media

Una WER «media» se calcula de dos maneras. Primera frase: la persona dice «no gracias», la máquina escribe «sí gracias» —un error en dos palabras, 50 %—. Segunda frase: dieciocho palabras, todas correctas, 0 %. La media de las dos frases da un 25 %; el total de errores sobre el total de palabras, 1 ÷ 20 = 5 %. Los dos cálculos son correctos, y ninguno dice que el único error convirtió un rechazo en un sí. Una media entre conjuntos de prueba mezcla igualmente condiciones sin relación: en el artículo de Whisper, el 12,8 % de media del modelo más grande (tabla 2) abarca un 2,7 % con libros leídos y un 36,4 % con reuniones captadas por un solo micrófono lejano.

Seis preguntas antes de creerse una cifra

  • ¿Qué conjunto de prueba? Leído o espontáneo, libros o llamadas, en qué idioma.
  • ¿Qué sonido? Banda ancha, o línea telefónica a 8 kilohercios.
  • ¿Qué normalización? Vacilaciones, números, mayúsculas: quitados o contados.
  • ¿Qué modo? Diferido o en tiempo real.
  • ¿Qué cálculo? Total de errores, media por frase, mediana por dominio.
  • ¿Quién midió? El proveedor o un tercero, y si el método está publicado.

Aún no tenemos una WER medida en nuestras llamadas: hace falta un corpus transcrito a mano, que es el lote piloto del programa. Cuando exista, la cifra se publicará en el cuaderno con estas seis respuestas. En español aún no hemos hecho ninguna llamada, y por tanto no hay cifra. Mientras tanto, solo citamos cifras de terceros, con su nombre y su fuente. Para las preguntas que van más allá de la transcripción: Evaluar a un proveedor de voz IA: diez preguntas.

Lo que Nodical sabe hacer hoy

Una tasa de error de palabras no dice si una llamada ha servido para algo: una cita fijada el día correcto, un cliente al que se ha devuelto la llamada, un expediente al día. Es lo que describe la página lo que Nodical sabe hacer hoy, en torno al agente de voz.

¿Y en la práctica? lo que Nodical sabe hacer hoy

Fuentes

consultadas el 1 de octubre de 2026.

  1. OpenAI, « Robust Speech Recognition via Large-Scale Weak Supervision » (article Whisper : section 3.2 sur la normalisation, tableaux 2 et 8) — https://cdn.openai.com/papers/whisper.pdf
  2. arXiv 2510.06961, « Open ASR Leaderboard » (jeux de test, normalisation du texte, octobre 2025) — https://arxiv.org/html/2510.06961v1
  3. Vexascribe, « How accurate is Deepgram? Nova-3 WER benchmarks (2026) » (mis à jour le 25 août 2026) — https://vexascribe.com/how-accurate-is-deepgram
  4. Deepgram, « Introducing Nova-3: setting a new standard for AI-driven speech-to-text » (jeu de test de l'éditeur) — https://deepgram.com/learn/introducing-nova-3-speech-to-text-api
  5. Coval, « Best STT providers 2026: independent benchmarks and how to choose » (4 juin 2026) — https://www.coval.ai/blog/best-speech-to-text-providers-in-2026-independent-benchmarks-and-how-to-choose/
  6. OpenSLR, LibriSpeech ASR corpus (« environ 1 000 heures de parole anglaise lue à 16 kHz ») — https://www.openslr.org/12

Correcciones

Ninguna corrección hasta la fecha.