ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.
SaberEl silencio al teléfono: ruido, respiración, duda
Un detector de actividad de voz decide, cada pocas decenas de milisegundos, si oye voz o no; al teléfono, el ruido, la respiración y las dudas lo engañan, y las cifras más citadas, las de Picovoice en su propio banco de pruebas, se refieren a inglés leído y no a llamadas.
Qué hace un detector de actividad de voz
Antes de entender lo que alguien dice, un agente de voz tiene que saber si está diciendo algo. Es la tarea del detector de actividad de voz (VAD, por voice activity detection): corta el sonido en fragmentos de unas pocas decenas de milisegundos y devuelve, para cada uno, una probabilidad: voz o no voz. Por encima de un umbral, el agente considera que la persona habla; por debajo, que calla. Todo lo demás depende de ello: cuándo transcribir, cuándo callarse si la persona retoma, cuándo empezar a contar el silencio.
El detector del proyecto WebRTC, publicado en código abierto por Google, se basa en el tratamiento clásico de la señal; los más recientes son redes neuronales, como Silero (abierto) o Cobra (que vende Picovoice).
Lo que no es silencio
Al teléfono, el «silencio» entre dos frases casi nunca es silencioso. El detector tiene que distinguir entre:
- el ruido: una calle, un coche, una tele. Las voces de los demás son lo peor: es habla, pero no la de la persona a la que se llama;
- la respiración: una inspiración antes de contestar: no es habla, pero a menudo anuncia que llega;
- la duda: «eh», «esto…», «pues…», «o sea»: habla sin palabras útiles que, sin embargo, dice algo importante: la persona no ha terminado;
- la propia línea: chisporroteo, eco de la voz del agente que vuelve por el teléfono de la persona.
Tomar un ruido por voz hace callar al agente para nada. Tomar la voz por ruido hace perder el principio de un «no», o cortar a alguien que retomaba tras una duda.
Cómo se mide un detector
Un detector se ajusta con un umbral, y cada umbral da dos cifras. La tasa de detección: la proporción de fragmentos de voz reconocidos como voz. La tasa de falsas alarmas: la proporción de fragmentos sin voz tomados por error como voz. Bajar el umbral hace subir las dos. Por eso solo se comparan dos detectores con la misma tasa de falsas alarmas, o sobre la curva que une ambas cifras para todos los umbrales (la curva ROC). Un porcentaje de «precisión» publicado solo, sin la tasa de falsas alarmas que le corresponde, no dice nada.
Lo que publica Picovoice
Picovoice, editor canadiense de software de voz que funciona en el propio dispositivo, mantiene el banco de pruebas más citado sobre el tema. Hay que leerlo por lo que es: el banco de pruebas de Picovoice, construido para comparar su propio producto, Cobra, con dos detectores abiertos, el de WebRTC y Silero (versión 5.1). Su código y sus datos son públicos, lo que permite repetirlo. El método: habla inglesa leída, sacada de LibriSpeech, un corpus de audiolibros grabado a 16 kHz, mezclada con ruidos reales del corpus DEMAND (18 entornos, entre ellos cocina, oficina y tráfico), con una relación señal-ruido de 0 dB, es decir, un ruido tan fuerte como la voz.
Los resultados, detallados por Picovoice en una comparativa publicada en noviembre de 2025 y actualizada en enero de 2026, se leen con una tasa de falsas alarmas fija. Son tasas de detección por fragmento de sonido, no tasas de acierto por frase ni por llamada:
| Detector | Tasa de detección con un 5 % de falsas alarmas | Tasa de detección con un 1 % de falsas alarmas |
|---|---|---|
| Cobra (Picovoice) | 98,9 % | 95 % |
| Silero 5.1 | 87,7 % | 80,4 % |
| WebRTC | 50 % | no publicado (tasa demasiado baja según Picovoice) |
Banco de pruebas de Picovoice: LibriSpeech test-clean (inglés leído, 16 kHz) mezclado con el ruido DEMAND a 0 dB. Cifras publicadas por Picovoice, no repetidas por ASDIC.
La propia Picovoice señala que la clasificación depende del umbral: con un 25 % de falsas alarmas, WebRTC lo hace mejor que Silero. Su conclusión es la correcta, y vale también para sus propias cifras: evaluar un detector con la tasa de falsas alarmas que la aplicación pueda tolerar.
Por qué esto todavía no es el teléfono
Este banco de pruebas mide algo real, la resistencia al ruido, en condiciones que no son las de una llamada. La voz es leída, no conversada: sin dudas, sin «eh», sin frases que vuelven a empezar. Está en inglés. Está en banda ancha, a 16 kHz, mientras que la línea telefónica corta todo lo que pasa de 3.400 Hz (véase la página sobre el audio a 8 kHz). El ruido se añade después, no se capta con la voz ni pasa luego por la compresión de la línea. Silero, por su parte, acepta sonido a 8 kHz y a 16 kHz, pero sus propias evaluaciones publicadas se hacen a 16 kHz. Que sepamos, nadie ha publicado una comparación de detectores con llamadas telefónicas reales, ni en español ni en francés.
Detectar la voz no dice cuándo responder
Un detector perfecto diría exactamente cuándo habla la persona y cuándo calla. Seguiría sin decir si ha terminado. «Quería… eh…» seguido de un silencio no es el final de una frase; «No, gracias.» seguido del mismo silencio sí lo es. El banco de pruebas eot-bench de LiveKit cuantifica lo que cuesta responder solo al silencio, con sus datos de validación en inglés: tras 300 milisegundos de silencio, se corta la palabra por error el 55,6 % de las veces; tras 600 milisegundos, todavía el 21,7 %; y hay que esperar 1,6 segundos para cortar solo una vez de cada veinte. El VAD es el punto de partida de la decisión de fin de turno, no la decisión en sí; ese es el tema de la página sobre el fin de turno de palabra.
Dónde está ASDIC
No tenemos ninguna medición de detección de actividad de voz en nuestras llamadas: harían falta llamadas en las que cada pasaje esté marcado a mano (voz, ruido, respiración, duda). Lo que medimos hoy viene después: en septiembre de 2026, en llamadas en francés, el agente responde 0,14 segundos (mediana; 1,32 segundos en 9 de cada 10 respuestas) después de decidir que la persona había terminado, sin contar la detección de fin de habla. Nuestro objetivo está escrito como objetivo: responder en menos de 0,5 segundos, interrumpiendo menos del 5 % de las veces. No está alcanzado; se publicará con la medición que lo demuestre, en el cuaderno.
Una línea que atiende a cualquier hora
Una línea que responde día y noche lo oye todo: llamadas desde un coche o desde una obra, personas que buscan sus palabras. La diferencia entre silencio, ruido y duda se juega ahí en cada frase. Nodical explica en su web cómo sus agentes atienden día y noche.
¿Y en la práctica? cómo sus agentes atienden día y noche
Fuentes
consultadas el 1 de octubre de 2026.
- Picovoice, « Voice Activity Detection Benchmark » (page officielle du banc d'essai : Cobra, WebRTC VAD, Silero VAD ; courbe ROC) — https://picovoice.ai/docs/benchmark/vad/
- Picovoice, dépôt « voice-activity-benchmark » (LibriSpeech test-clean mélangé au bruit DEMAND, courbes tracées à 0 dB de rapport signal sur bruit ; Silero version 5.1) — https://github.com/Picovoice/voice-activity-benchmark
- Picovoice, « Choosing the Best Voice Activity Detection in 2026: Cobra vs Silero vs WebRTC VAD » (12 novembre 2025, mis à jour le 23 janvier 2026 ; taux de détection à 5 % et 1 % de fausses alertes) — https://picovoice.ai/blog/best-voice-activity-detection-vad/
- Silero VAD, dépôt officiel (licence MIT, 8 000 et 16 000 Hz, moins d'1 ms par tranche de 30 ms et plus sur un seul fil d'exécution du processeur) — https://github.com/snakers4/silero-vad
- OpenSLR, LibriSpeech (« environ 1 000 heures d'anglais lu à 16 kHz ») — https://www.openslr.org/12/
- LiveKit, eot-bench (classement et jeu de données) — https://github.com/livekit/eot-bench
- ASDIC, « Fin de tour de parole : attendre le silence ne suffit pas » — https://asdic.ai/savoir/fin-de-tour-de-parole-attendre-le-silence-ne-suffit-pas
Correcciones
Ninguna corrección hasta la fecha.