ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.
SaberMedir un agente de voz: las cinco cifras que importan
Las comparativas de agentes de voz miden casi todas una sola cosa, el tiempo hasta el primer sonido, cuando una llamada saliente depende de cinco decisiones; publicamos esas cinco mediciones, en mediana y para 9 de cada 10 llamadas, a partir de nuestras propias llamadas.
Lo que miden las comparativas, y por qué no basta
Cuando se comparan agentes de voz, casi siempre se mide la latencia: el tiempo entre el momento en que la persona calla y el momento en que el agente empieza a hablar. El banco de pruebas más serio que conocemos, OpenBenchmarks, lo llama TTFAB (time to first audio byte) y lo mide como es debido, en llamadas telefónicas reales, grabando ambos lados con el mismo reloj. Sus registros de agosto de 2026 dan, para cinco plataformas del mercado, medianas entre 1,3 y 1,7 segundos y p95 entre 1,8 y 2,3 segundos. Es útil, y hay que reconocérselo. Pero es una sola cifra, y no dice si el agente reconoció un contestador, si cortó la palabra, si transfirió en el momento adecuado ni si entendió algo. Un agente puede responder rápido y hacer cualquier cosa.
Las cinco cifras que publicamos
1. El tiempo para saber con quién se habla
Cuánto tarda el agente, tras descolgar, en saber si habla con una persona o con un buzón. Es la primera decisión de la llamada y condiciona todas las demás. Hoy: 8 segundos (mediana), 14 segundos en 9 de cada 10 llamadas. Objetivo: menos de 2 segundos.
2. El retraso de fin de turno
Cuánto pasa entre la última palabra de la persona y la primera del agente: la espera real, la que se percibe. Es la cifra más parecida a la «latencia» de las comparativas, con una diferencia: debe incluir la decisión de que la frase ha terminado, no solo la fabricación de la respuesta. Hoy solo medimos la segunda parte (0,14 segundos de mediana, 1,32 segundos en 9 de cada 10 respuestas); la medición completa requiere un corpus anotado. Objetivo: menos de 0,5 segundos.
3. La tasa de cortes
La proporción de turnos en que el agente habló cuando la persona no había terminado. Esta cifra va de la mano de la anterior: siempre se puede responder más rápido cortando más a menudo. El banco de pruebas eot-bench de LiveKit muestra el tamaño del compromiso para un detector que solo escucha el silencio: 55,6 % de cortes por error respondiendo tras 300 milisegundos, 21,7 % tras 600, con sus datos en inglés. Aún no lo hemos medido en nuestras llamadas. Objetivo: menos del 5 %.
4. La tasa de transferencias erróneas
Cuando el agente pasa la llamada a una persona, ¿era el momento adecuado? Demasiado pronto desperdicia a un asesor; demasiado tarde, la persona ya ha colgado. Hoy: el 1,19 % de las llamadas atendidas se transfieren, a los 135 segundos (mediana); aún no sabemos qué parte de esas transferencias era pertinente. Objetivo: más de 9 de cada 10 transferencias juzgadas pertinentes.
5. La duración de la llamada
La cifra más simple, y la más olvidada. Da la escala de todas las demás: en nuestras llamadas de septiembre de 2026, la mitad de las llamadas atendidas duran 10 segundos o menos, y 8 de cada 10 menos de 20 segundos. Una decisión que llega a los 8 segundos llega, en muchas llamadas, cuando la conversación ya ha terminado.
Cómo leer una mediana y un p90
Nunca publicamos una media: unas pocas llamadas muy largas la distorsionan. La mediana es el valor que divide las llamadas en dos mitades: la mitad lo hace mejor, la mitad peor. El p90 es el valor por debajo del cual quedan 9 de cada 10 llamadas; describe la experiencia de quienes más esperaron. Un agente puede tener una buena mediana y un mal p90: rápido en general y a veces muy lento, lo que, al teléfono, se nota. Los bancos de pruebas serios publican ambos; las páginas comerciales suelen publicar solo el mejor.
Lo que aún no medimos
De estas cinco cifras, dos se miden hoy (el retraso persona-o-contestador, la duración), una a medias (el retraso de fin de turno, sin la decisión), y dos esperan un corpus anotado a mano (cortes, pertinencia de las transferencias). El cuaderno dice en cada entrada cuál ha avanzado. Preferimos publicar «aún no medido» a una cifra tomada de otro sitio.
Lo que Nodical hace con estas mediciones
Estas cinco cifras son las que mira un cliente, lo sepa o no: una llamada demasiado larga cuesta, un corte hace colgar, una transferencia fallida pierde un contacto. Nodical explica en su web lo que hace con estas mediciones en sus campañas.
¿Y en la práctica? lo que Nodical hace con estas mediciones
Fuentes
consultadas el 1 de octubre de 2026.
- OpenBenchmarks, « Voice agent latency benchmark (2026), TTFAB from real phone calls » (dernier appel : 1er août 2026) — https://openbenchmarks.com/voice-agent-latency
- LiveKit, eot-bench (classement et jeu de données) — https://github.com/livekit/eot-bench
- Hamming.ai, « Voice AI latency: what's fast, what's slow » — https://hamming.ai/resources/voice-ai-latency-whats-fast-whats-slow-how-to-fix-it
- Telnyx, « Voice AI agents compared on latency » — https://telnyx.com/resources/voice-ai-agents-compared-latency
- ASDIC, carnet n° 1 : « Septembre 2026 : première mesure » — https://asdic.ai/carnet/2026-09-premiere-mesure
Correcciones
Ninguna corrección hasta la fecha.