ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.
SaberFin de turno de palabra: esperar el silencio no basta
Un agente de voz debe decidir en cada instante si la persona ha terminado su frase o solo toma aire; esperar un silencio fijo significa interrumpir si se espera poco y hacer esperar si se espera mucho, y ninguna medición publicada dice qué pasa en francés o en español, al teléfono.
Dos preguntas que se confunden
«¿Sigue hablando?» y «¿Ha terminado?» no son la misma pregunta. La primera es acústica: hay sonido, o no lo hay. Es el trabajo de un detector de actividad de voz (VAD), que marca el final de un segmento de habla cuando el silencio supera un umbral. La segunda es cuestión de sentido y de música: «Quería pedir cita…» seguido de un silencio no es el final de una frase, es una vacilación; «No, gracias.» seguido del mismo silencio sí lo es. Las personas lo deciden sin pensar, por la entonación, el ritmo, las palabras. Una máquina que solo escucha el silencio se equivoca en los dos sentidos.
El compromiso que impone el silencio
Con un umbral de silencio, todo se reduce a una cifra: cuántos milisegundos esperar. Esperar poco, y el agente interrumpe a cada respiración. Esperar mucho, y cada respuesta llega tras un hueco que la persona percibe como lentitud, o como una línea cortada. El banco de pruebas abierto de LiveKit, eot-bench, cuantifica este compromiso para un detector que solo escucha el silencio (con sus datos de validación en inglés): respondiendo tras 300 milisegundos de silencio, se corta la palabra por error el 55,6 % de las veces; tras 600 milisegundos, todavía el 21,7 %; para cortar solo una vez de cada veinte, hay que esperar 1,6 segundos. Un modelo que también escucha las palabras y la entonación lo hace mucho mejor: para el suyo, LiveKit anuncia en su artículo de junio de 2026 un 9,9 % de cortes por error con 300 milisegundos de margen y un 4,5 % con 600. Esas cifras son suyas, con sus datos; dicen sobre todo una cosa: de este compromiso no se sale ajustando el umbral, se sale escuchando algo distinto del silencio.
Lo que publican quienes trabajan el tema
LiveKit publicó un modelo de fin de turno y un banco de pruebas abierto, eot-bench, cuyo conjunto de datos cubre catorce idiomas, francés y español incluidos. El artículo da resultados por idioma, pero no dice nada de telefonía: las conversaciones son grabaciones en banda ancha entre una persona y un agente, nunca en una línea. Daily (Pipecat) ofrece Smart Turn v3, un modelo abierto (licencia BSD) de ocho megabytes que corre en unos doce milisegundos en un procesador normal y cubre veintitrés idiomas; su corpus se recogió de la comunidad, no de llamadas reales, y tampoco publica mediciones por idioma ni al teléfono. Picovoice escribió la guía más didáctica sobre latencia, turnos e interrupción, para asistentes embarcados, en inglés. Kyutai, laboratorio francés, publica un reconocimiento de voz en flujo con un «VAD semántico» que decide en medio segundo aproximadamente si la frase ha terminado: abierto, francés-inglés, pero sin medición al teléfono. En investigación, dos artículos de 2026 marcan la dirección: uno aprende a predecir la duración del silencio que viene en lugar de esperarlo (Next-Turn); el otro busca qué aspectos del habla llevan de verdad la información de fin de turno. Por último, Luqia publicó en septiembre de 2026 el único banco de pruebas de diálogo en francés que conocemos, lo que dice bastante de lo vacío que está el terreno.
Por qué el teléfono lo cambia todo
Al teléfono, el sonido es estrecho (banda de 300 a 3.400 Hz) y comprimido, se pierden paquetes, y la entonación —justo lo que dice «he terminado»— se oye peor. Los modelos citados aprendieron con habla en banda ancha; nada dice cómo se comportan en una línea, en español o en francés, con alguien que habla deprisa porque tiene prisa por colgar. Es una de las razones por las que el audio telefónico a 8 kHz tiene su propia página en este sitio.
Dónde está ASDIC
En septiembre de 2026, en las llamadas de Nodical, el agente responde 0,14 segundos después de decidir que la persona había terminado (1,32 segundos en 9 de cada 10 respuestas). Esa cifra excluye la propia decisión: mide la generación de la respuesta, no la espera. Es, por tanto, la decisión de fin de turno la que hace esperar, y es la que aún no sabemos medir sin un corpus anotado a mano, que registre, en cada turno, el instante en que la persona había terminado de verdad. Nuestro objetivo está escrito como objetivo: responder en menos de 0,5 segundos, interrumpiendo menos del 5 % de las veces. No está alcanzado; se publicará con la medición que lo demuestre. El método y los límites de la medición de septiembre están en el cuaderno.
Lo que cambia durante una llamada
Un agente que interrumpe hace colgar; un agente que espera demasiado hace dudar de que haya alguien. Entre ambos está la diferencia entre una conversación y un formulario de voz. Nodical describe en su web lo que sus agentes hacen hoy durante la llamada.
¿Y en la práctica? lo que Nodical hace hoy durante la llamada
Fuentes
consultadas el 1 de octubre de 2026.
- LiveKit, « Solving end-of-turn detection: Turn Detector v1.0 » (17 juin 2026) — https://livekit.com/blog/solving-end-of-turn-detection
- LiveKit, eot-bench (classement et jeu de données) — https://github.com/livekit/eot-bench
- Daily, « Announcing Smart Turn v3 » — https://www.daily.co/blog/announcing-smart-turn-v3-with-cpu-inference-in-just-12ms/
- Picovoice, « Voice agent latency, turn-taking, and barge-in » — https://picovoice.ai/guide/voice-agents/voice-ux-latency-turn-taking/
- Kyutai, reconnaissance vocale en flux avec « semantic VAD » — https://kyutai.org/stt/
- arXiv 2606.18094, « Next-Turn: duration-aware streaming endpoint detection » — https://arxiv.org/pdf/2606.18094
- arXiv 2609.11066, « Less can be More: what aspects of speech drive end-of-turn detection » — https://arxiv.org/pdf/2609.11066
- arXiv 2609.10765, Luqia, « French Full-Duplex Benchmark » (septembre 2026) — https://arxiv.org/abs/2609.10765
Correcciones
Ninguna corrección hasta la fecha.