de Nodical

ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.

Saber

Detectar un contestador en menos de dos segundos: lo que existe hoy

Publicado el Por Douglas DemartEstado del proyecto a 1 de octubre de 2026

En una frase

Reconocer que una llamada ha caído en un buzón de voz lleva hoy varios segundos, porque los métodos habituales esperan el pitido o escuchan la cadencia del habla; en nuestras llamadas de septiembre de 2026 la decisión llega a los 8 segundos (mediana), y nuestro objetivo es bajar de 2 segundos.

Por qué es difícil

Cuando una persona descuelga, dice una palabra corta — «¿Diga?» — y luego calla y espera. Un contestador hace lo contrario: habla largo, sin esperar respuesta, y después emite un pitido. Sobre el papel, la diferencia es clara. Al teléfono no lo es: el mensaje del buzón empieza a veces con un silencio, a veces con una frase del operador, a veces con la voz de la propia persona («Hola, has llamado a…»). El sonido es estrecho (banda telefónica, 8 kHz), el inicio suele llegar cortado, y el agente debe decidir rápido: hablar a un buzón como a una persona hace perder tiempo y dinero; colgar a una persona tomada por un buzón es peor.

El tiempo cuenta por partida doble. En nuestras llamadas de septiembre de 2026, la mitad de las llamadas atendidas por una persona duran diez segundos o menos. Una decisión que llega a los ocho segundos llega, en muchas llamadas, cuando la conversación ya ha ocurrido.

Las tres formas de reconocer un buzón

1. Esperar el pitido

El método más antiguo escucha la señal y busca el tono que cierra el mensaje. Es fiable cuando el pitido es nítido, pero no puede decir nada antes de que llegue, es decir, después de todo el mensaje. Falla cuando el pitido es débil, no existe o queda sepultado en el sonido comprimido de la línea; Plura detalla estos casos de fallo en un artículo citado al pie.

2. Escuchar la cadencia

El segundo método no escucha las palabras sino el ritmo: cuánto tiempo habla el interlocutor, cuánto calla, si espera una respuesta. Una persona dice unas palabras y deja un hueco; un contestador sigue. Es el principio de los detectores integrados en los operadores de telefonía, y el del artículo publicado en arXiv en abril de 2026 («Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features»), que muestra que se puede decidir en tiempo real solo con esos indicios de actividad de habla. El método necesita unos segundos de escucha para estar seguro: con muy pocos, una persona habladora parece un buzón.

3. Transcribir y clasificar

El tercer método transcribe las primeras palabras y las clasifica: «ha llamado al buzón de voz de» no deja dudas, y «¿Diga, sí?» tampoco. Es el más preciso cuando la transcripción es buena, pero depende de la calidad del reconocimiento de voz al teléfono y tiene que esperar a tener palabras. Los proveedores recientes de agentes de voz suelen combinar cadencia y transcripción, dejando el pitido como red de seguridad.

Lo que publican quienes venden la detección

Twilio, cuya documentación es la más completa, indica que su detector devuelve el resultado en unos cuatro segundos con los ajustes por defecto, y que su espera máxima se regula entre 3 y 59 segundos (30 por defecto). Sus preguntas frecuentes anuncian una precisión «cercana al 100 %» en Estados Unidos y reconocen que es menor a nivel internacional; no se publica ninguna cifra por idioma. Regal.ai describe un modelo propio que presenta como mejor que el mercado, medido en sus propias llamadas norteamericanas. Vapi documenta varias estrategias a elección de sus clientes. Ninguna de esas páginas da una medición sobre llamadas europeas, ni trata los buzones de los operadores españoles o franceses.

Dónde está ASDIC

No vendemos un detector; construimos un modelo que debe decidir antes, y publicamos nuestras mediciones tal como son. En septiembre de 2026, en la base de producción de Nodical (60.287 llamadas atendidas por una persona, 14 campañas, sin leer el contenido de las conversaciones), el contestador se reconoce a los 8 segundos (mediana) y a los 14 segundos en 9 de cada 10 llamadas. Es demasiado tarde, y es exactamente lo que el programa 2027-2028 debe cambiar.

Nuestro objetivo está escrito como objetivo: menos de 2 segundos, con menos del 3 % de error. No está alcanzado. Se publicará con la medición que lo demuestre, no antes. El detalle de la medición de septiembre, su método y sus límites están en la primera entrada del cuaderno.

Por qué Europa es más difícil que Estados Unidos

Tres razones, que se suman. Los mensajes de buzón son más variados: cada operador tiene los suyos, en cada idioma, y muchas personas graban el suyo. Las llamadas son multilingües: un mismo modelo debe funcionar en francés, español e inglés sin construir uno por idioma. Por último, las mediciones publicadas se hicieron en otro lugar: un detector «cercano al 100 %» con buzones americanos nunca ha oído «el teléfono móvil al que llama está apagado o fuera de cobertura». Por eso medimos en casa, y por eso publicaremos el método junto con los resultados.

Lo que cambia para una campaña de llamadas

Cada segundo hablando con un buzón se factura, y cada persona a la que se cuelga por error es un contacto perdido. Para un equipo que deja llamar a un agente de voz, «persona o contestador» es la primera decisión de la llamada, y condiciona todas las demás: cuándo hablar, qué decir, cuándo transferir. Nodical explica en su web lo que cambia para una campaña de llamadas.

¿Y en la práctica? lo que cambia para una campaña de llamadas

Fuentes

consultadas el 1 de octubre de 2026.

  1. Twilio, « Answering Machine Detection » (documentation) — https://www.twilio.com/docs/voice/answering-machine-detection
  2. Twilio, « AMD FAQ & Best Practices » — https://www.twilio.com/docs/voice/answering-machine-detection-faq-best-practices
  3. arXiv 2604.09675, « Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features » (avril 2026) — https://arxiv.org/html/2604.09675v1
  4. Plura, « Voicemail beep detection: how it works and why it fails » — https://www.plura.ai/articles/voicemail-beep-detection
  5. Regal.ai, « How we built a voicemail detection model » — https://www.regal.ai/blog/how-we-built-an-answering-machine-detection-model-that-outperforms-the-industry
  6. Vapi, « Voicemail detection » (documentation) — https://docs.vapi.ai/calls/voicemail-detection

Correcciones

Ninguna corrección hasta la fecha.