ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.
SaberEl pitido del contestador: por qué nunca llega cuando lo esperas
Saber que se habla con un buzón de voz y saber cuándo empieza a grabar son dos decisiones distintas; la segunda depende de un pitido que ni está normalizado ni aparece siempre, y ninguna de las fuentes que hemos leído publica una medición de esa decisión en buzones europeos.
Dos decisiones, no una
Cuando un agente de voz cae en un buzón, tiene que resolver dos cosas. Primero: ¿persona o máquina? Es la detección de contestador, que tiene su propia página. Después, si quiere dejar un mensaje: ¿en qué instante empieza a grabar el buzón? La primera decisión puede tomarse con las primeras palabras de la locución. La segunda, solo al final, y ese final suele marcarlo un pitido. Ahí está todo el problema: el pitido nunca llega en el mismo momento, nunca suena exactamente igual y a veces no llega nunca.
Plura, que vende un software de llamadas salientes, resume la diferencia: la detección de contestador dice quién ha descolgado; la detección del pitido dice cuándo empieza la grabación.
Lo que se oye antes del pitido
- Una locución del operador, del tipo «La persona a la que llama no está disponible en este momento. Deje su mensaje después de la señal». La misma para millones de clientes, pero distinta de un operador y de un país a otro.
- Un mensaje personal: tres segundos o cuarenta, con música, un silencio en medio, a veces un «¿Diga?» que imita un descuelgue de verdad.
- Las dos cosas seguidas: el mensaje personal y luego la frase del operador.
- Un mensaje de la red («el teléfono móvil al que llama está apagado o fuera de cobertura»): ni persona ni buzón, así que no hay pitido, porque nada graba.
Twilio da un orden de magnitud para las locuciones cortas: normalmente de 1 a 2 segundos de voz, luego de 1,2 a 2,4 segundos de silencio y después más sonido antes del pitido. Un detector que toma ese silencio por el final de la locución se equivoca; Twilio reconoce que el suyo puede tomar una locución de dos segundos por una persona que descuelga. En el otro extremo, sus preguntas frecuentes aconsejan dar tiempo al pitido, porque algunas locuciones son muy largas.
Un pitido sin norma
Twilio lo dice sin rodeos: lo que se considera un «pitido» de buzón varía mucho de un destino a otro, y a veces se confunde con los tonos habituales de la red hasta el punto de no poder distinguirlos. Plura va en la misma dirección: frecuencia y duración del pitido no están estandarizadas, un detector ajustado al buzón de un operador falla a menudo con el de otro, y muchos buzones modernos no emiten ningún pitido: recurren a un silencio, a una frase o a ambas cosas.
La línea añade sus propios defectos: banda estrecha, compresión, paquetes perdidos (véase la página sobre el audio a 8 kHz). Un pitido puede llegar cortado; una música dentro de la locución puede parecer un pitido.
Qué hace la opción DetectMessageEnd de Twilio
Twilio ofrece dos modos. Enable responde en cuanto sabe quién ha descolgado; sirve sobre todo para pasar a un agente solo las llamadas humanas. DetectMessageEnd está pensado para dejar un mensaje: responde de inmediato si oye a una persona, pero ante una máquina espera al final de la locución. Devuelve entonces uno de tres resultados: locución terminada en pitido, en silencio o en otra cosa (un tono, un mensaje de error). Ese tercer resultado sirve también de recurso cuando se agota el tiempo máximo antes del final. Salvo necesidad concreta, escribe Twilio, los tres significan lo mismo: ha contestado una máquina.
Ese tiempo máximo se ajusta entre 3 y 59 segundos (30 por defecto); si es demasiado corto, la escucha se detiene antes del pitido. Y es para este modo, con los ajustes por defecto, para el que Twilio anuncia una precisión «cercana al 100 %» hacia Estados Unidos, menor a nivel internacional porque los tonos de los buzones cambian de un país a otro. No se publica ninguna cifra para España ni para Francia.
Por qué esperar el pitido sale caro
Esperar el pitido es escuchar toda la locución: demasiado tarde para decidir «persona o máquina». El artículo publicado en arXiv en abril de 2026 sobre la detección de buzones en tiempo real apunta en esa dirección: añadir indicios basados en el pitido no mejoró su mejor configuración y alargó claramente el retraso. El pitido no ayuda a saber con quién se habla; sigue siendo la única referencia para saber cuándo hablar. En nuestras llamadas de septiembre de 2026, en francés, el contestador se reconoce a los 8 segundos (mediana) y a los 14 segundos en 9 de cada 10 llamadas. No medimos el instante del pitido: no sabemos, por tanto, cuánto tiempo separa en nuestras llamadas el reconocimiento del contestador de la apertura de la grabación.
Dejar un mensaje: lo que implica
Si se lanza demasiado pronto, el mensaje queda cortado: empieza durante la locución, y el buzón solo graba el final, o un silencio. Plura aconseja esperar al final del pitido más un breve margen, sobre todo cuando la locución ha terminado en silencio. Si se lanza demasiado tarde, empieza con un hueco que parece una llamada vacía. De ahí unas reglas sencillas:
- decir lo esencial primero —quién llama, por qué, cómo devolver la llamada— para que un inicio cortado no haga perder el sentido;
- ser breve;
- no dejar nada cuando el final de la locución es incierto, antes que un mensaje grabado a medias;
- preguntarse si la voz es el canal adecuado: un texto llega entero y conserva el número al que llamar.
Dónde está ASDIC
Nuestro modelo debe responder antes a la primera pregunta: el objetivo es reconocer un contestador en menos de 2 segundos, con menos del 3 % de error. No está alcanzado; se publicará con la medición que lo demuestre, no antes. La segunda pregunta, el instante en que empieza la grabación, requiere llamadas anotadas a mano, en las que se marque para cada buzón el instante del pitido, o su ausencia. Mientras ese trabajo no esté hecho, no publicamos ninguna cifra sobre el pitido. La medición de septiembre y sus límites están en la primera entrada del cuaderno.
Cuándo es mejor escribir
Un mensaje de voz depende de un pitido que nadie controla; un mensaje escrito, no. Nodical explica en su web, a propósito de las llamadas perdidas, cuándo es mejor enviar un SMS, y lo que un SMS no sustituye.
¿Y en la práctica? cuándo es mejor enviar un SMS
Fuentes
consultadas el 1 de octubre de 2026.
- Twilio, « Answering Machine Detection » (documentation : modes Enable et DetectMessageEnd, réglages, annonces courtes) — https://www.twilio.com/docs/voice/answering-machine-detection
- Twilio, « AMD FAQ & Best Practices » (résultats machine_end_*, définition variable du bip, précision de DetectMessageEnd) — https://www.twilio.com/docs/voice/answering-machine-detection-faq-best-practices
- Plura, « Voicemail Beep Detection: AMD vs. Beep Timing Explained » (17 août 2026, mis à jour le 29 septembre 2026) — https://www.plura.ai/articles/voicemail-beep-detection
- arXiv 2604.09675, « Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features » (avril 2026) — https://arxiv.org/abs/2604.09675
- ASDIC, carnet n° 1 : « Septembre 2026 : première mesure » — https://asdic.ai/carnet/2026-09-premiere-mesure
Correcciones
Ninguna corrección hasta la fecha.