de Nodical

ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.

Saber

El vocabulario de la voz al teléfono, en veinte palabras

Publicado el Por Douglas DemartEstado del proyecto a 1 de octubre de 2026

En una frase

Las páginas sobre agentes de voz al teléfono hablan una jerga hecha de siglas en inglés; aquí están las veinte palabras que más aparecen, definidas cada una en pocas frases sencillas y enlazadas a la página de este sitio que las desarrolla.

Cómo leer este glosario

Los agentes de voz tienen su jerga, a menudo en inglés, a menudo en siglas. Aquí van veinte términos, ordenados como una llamada y no alfabéticamente, cada uno enlazado a la página de este sitio que lo desarrolla. Las cifras de terceros llevan el nombre de su autor; su fuente está al pie de la página. Para ver estas palabras en acción en una llamada real, lea Diez segundos: qué pasa cuando descuelgan.

El sonido que pasa por la línea

Banda telefónica

Las frecuencias que transmite una línea telefónica clásica: de 300 a 3.400 hercios, según las recomendaciones de la Unión Internacional de Telecomunicaciones (UIT). El resto se corta, y las consonantes agudas, como la «s» o la «f», son las que más sufren. Véase Audio a 8 kHz.

8 kHz

La frecuencia de muestreo del teléfono: 8.000 medidas del sonido por segundo, valor fijado por la recomendación G.711 de la UIT. Los modelos de reconocimiento de voz aprenden en general con un sonido más rico, llamado «de banda ancha», y oyen pocas veces este. Véase Audio a 8 kHz.

G.711 (ley A, ley µ)

La codificación histórica de la voz telefónica, normalizada por la UIT: 8.000 muestras por segundo, ocho bits cada una, es decir, 64.000 bits por segundo. Existe en dos variantes, la ley A y la ley µ («mu»), que comprimen el sonido de forma distinta; entre dos países que no usan la misma, circula la ley A. Véase Audio a 8 kHz.

Quién habla, y cuándo

AMD (detección de contestador)

Answering machine detection: la decisión «persona o buzón» al inicio de una llamada saliente. Twilio indica que su detector devuelve el resultado en unos cuatro segundos con los ajustes por defecto; en las llamadas de Nodical, en septiembre de 2026, un contestador se reconoce al cabo de 8 segundos (mediana). Véase Detectar un contestador y El pitido del contestador.

VAD (detección de actividad de voz)

Voice activity detection: un detector que dice, instante a instante, si hay habla o no. No entiende nada: separa la voz del silencio y, mejor o peor, del ruido. Véase El silencio al teléfono.

Endpointing (detección de fin de habla)

La decisión de que un segmento de habla ha terminado, en general porque el silencio ha superado un umbral. El retraso de respuesta publicado para Nodical (0,14 segundos de mediana) se mide después de esa decisión, así que no la incluye. Véase Fin de turno de palabra.

Fin de turno

La decisión de que la persona ha terminado de verdad y de que le toca hablar al agente: «Quería…» seguido de un silencio no lo es. Con sus datos de validación en inglés, el banco de pruebas eot-bench de LiveKit muestra que un detector que solo escucha el silencio corta la palabra por error el 55,6 % de las veces si responde tras 300 milisegundos. Véase Fin de turno de palabra.

Barge-in (interrupción)

Hablar mientras el otro habla. Un agente debe poder ser interrumpido y callarse en el acto; cuando es él quien corta la palabra, es un fallo. La tasa de cortes será una de las mediciones que publique ASDIC; aún no está medida. Véase Medir un agente de voz.

Diarización

Saber quién habla en cada momento, separando la voz del agente de la de la persona. Es sencillo cuando cada lado de la llamada se graba en su propia pista, y más difícil cuando las voces se solapan. Véase Por qué el reconocimiento de voz falla por teléfono.

Cómo está construido el agente

Full-duplex

Un sistema que escucha y habla a la vez, en lugar de esperar su turno. Luqia Technologies, que publicó en septiembre de 2026 un banco de pruebas full-duplex en francés, describe estos modelos como capaces de escuchar, hablar, hacer pausas y responder durante la conversación. Véase Pipeline o speech-to-speech.

Speech-to-speech

Un modelo único que recibe habla y la produce, sin pasar por texto. Se opone al pipeline, que encadena reconocimiento de voz, modelo de lenguaje y síntesis de voz, y que puede verificarse paso a paso. Véase Pipeline o speech-to-speech.

Entender lo que se dice

WER (tasa de error de palabras)

Word error rate: las palabras sustituidas, omitidas y añadidas, divididas por el número de palabras pronunciadas; diez palabras dichas, una sustituida y otra omitida, dan un 20 %. Para Deepgram Nova-3, la comparativa de Vexascribe (agosto de 2026) registra un 2,6 % en lectura limpia y un 21,8 % en CallHome, un corpus de llamadas telefónicas. Véase Leer un benchmark.

SLU (comprensión del habla)

Spoken language understanding: pasar de lo que se dice a lo que significa, la intención y los datos útiles. En francés, la referencia es el corpus MEDIA, distribuido por ELRA desde 2005 y hoy gratuito para la investigación académica. Véase Entender lo que quiere la persona.

Intención

Lo que quiere la persona, en una etiqueta: «pedir cita», «que me llamen», «no me interesa». MEDIA solo estaba anotado en conceptos; en 2024 se publicó una versión anotada en intenciones. Véase Entender lo que quiere la persona.

Medir

Latencia

El tiempo que tarda el agente en reaccionar. La palabra es vaga: según quién mida, empieza en la última palabra de la persona o en la decisión de fin de habla, y termina en el primer sonido del agente o en el primer byte enviado. Antes de comparar, pregunte dónde empieza y dónde acaba la medición. Véase Medir un agente de voz y Evaluar a un proveedor de voz IA.

TTFAB (o TTFA)

Time to first audio byte: el tiempo entre el momento en que la persona calla y el primer sonido del agente. OpenBenchmarks lo mide en llamadas telefónicas reales, con ambos lados grabados en el mismo reloj; sus registros (última llamada el 1 de agosto de 2026) dan, para cinco plataformas, medianas de 1,3 a 1,7 segundos. Véase Medir un agente de voz.

Mediana, p90 y p95

La mediana divide las llamadas en dos mitades: la mitad lo hace mejor, la mitad peor. El p90 es el valor por debajo del cual quedan 9 de cada 10 llamadas, y el p95 aquel por debajo del cual quedan 19 de cada 20: describen a quienes más esperaron, algo que una media esconde. Véase Evaluar a un proveedor de voz IA.

Los datos con los que aprende el agente

Corpus anotado

Grabaciones a las que unas personas han añadido a mano lo que había que saber: la transcripción, el instante en que se reconoce un contestador, los finales de turno, las intenciones. Es lo que permite entrenar un modelo y medir sus errores; no existe ninguno público para llamadas reales en francés. Véase Un corpus de llamadas en francés.

Seudonimización

Tratar los datos de manera que ya no puedan atribuirse a una persona sin información adicional, guardada por separado y protegida (RGPD, artículo 4); en una llamada, significa retirar nombres, números y direcciones. Un dato seudonimizado sigue siendo un dato personal (considerando 26); solo un dato convertido en anónimo queda fuera del RGPD. Véase Un corpus de llamadas en francés.

Huella vocal

Una representación calculada a partir de la voz para reconocer a una persona concreta. El RGPD llama «datos biométricos» a los obtenidos a partir de un «tratamiento técnico específico» que permiten o confirman la identificación única de una persona; un modelo que reconoce un contestador o una intención no la necesita, y ASDIC no la fabricará. Véase IA soberana.

Estas palabras en un proyecto real

Estas veinte palabras sirven para hacer las preguntas correctas antes de dejar que un agente de voz haga o atienda llamadas: con qué rapidez sabe con quién habla, si corta la palabra, qué entiende, qué pasa con las grabaciones. Para pasar a la práctica, Nodical publica las guías prácticas de Nodical.

¿Y en la práctica? las guías prácticas de Nodical

Fuentes

consultadas el 1 de octubre de 2026.

  1. UIT-T, Recommandation P.310, « Transmission characteristics for telephone band (300-3400 Hz) digital telephones » — https://www.itu.int/rec/T-REC-P.310
  2. UIT-T, Recommandation G.711, « Pulse code modulation (PCM) of voice frequencies » (8 000 échantillons par seconde, huit bits par échantillon, loi A et loi µ) — https://www.itu.int/rec/T-REC-G.711
  3. Twilio, « AMD FAQ & Best Practices » (résultat en environ 4 secondes avec les réglages par défaut) — https://www.twilio.com/docs/voice/answering-machine-detection-faq-best-practices
  4. LiveKit, eot-bench (classement et jeu de données) — https://github.com/livekit/eot-bench
  5. arXiv 2609.10765, Luqia Technologies, « French Full-Duplex Benchmark for Spoken Dialogue Models » (septembre 2026) — https://arxiv.org/abs/2609.10765
  6. Vexascribe, « How accurate is Deepgram? Nova-3 WER benchmarks (2026) » (mis à jour le 25 août 2026) — https://vexascribe.com/how-accurate-is-deepgram
  7. arXiv 2403.19727, MEDIA : nouvelle annotation en intentions (ELRA, distribué depuis 2005) — https://arxiv.org/abs/2403.19727
  8. OpenBenchmarks, « Voice agent latency benchmark (2026), TTFAB from real phone calls » (dernier appel : 1er août 2026) — https://openbenchmarks.com/voice-agent-latency
  9. Règlement (UE) 2016/679 (RGPD), article 4, définitions « pseudonymisation » et « données biométriques » — https://gdpr-info.eu/art-4-gdpr/
  10. RGPD, considérant 26 (données pseudonymisées et données anonymes) — https://gdpr-info.eu/recitals/no-26/
  11. ASDIC, carnet n° 1 : « Septembre 2026 : première mesure » — https://asdic.ai/carnet/2026-09-premiere-mesure

Correcciones

Ninguna corrección hasta la fecha.