ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.
SaberPipeline o speech-to-speech: dos formas de poner una IA al teléfono
Un agente de voz puede encadenar tres modelos —uno escribe lo que oye, otro redacta la respuesta, un tercero la pronuncia— o confiarlo todo a un único modelo que escucha y habla a la vez; el primero se controla mejor, el segundo reacciona más rápido, y no conocemos ninguna medición publicada que compare los dos en llamadas telefónicas reales en francés o en español.
Dos formas de hacer hablar a una máquina
Para mantener una conversación, un agente de voz tiene que entender lo que se le dice, decidir qué responder y decirlo. Hay dos formas de organizarlo. La primera encadena tres modelos: un reconocimiento de voz que convierte la voz en texto, un modelo de lenguaje que redacta una respuesta y una síntesis de voz que la pronuncia. Se llama pipeline, o cadena. La segunda lo confía todo a un único modelo que recibe sonido y produce sonido, sin pasar por la escritura: es el speech-to-speech. Algunos escuchan y hablan a la vez, como hacemos al teléfono: se les llama full-duplex. Esa elección decide la rapidez de la respuesta, lo que pasa cuando alguien interrumpe al agente, lo que se puede comprobar y los idiomas que habla.
La cadena: oír, escribir, pensar, hablar
En una cadena, cada etapa tiene su modelo, y se puede cambiar uno sin tocar los demás. Según la documentación de OpenAI, la cadena sirve cuando se quiere «inspeccionar o transformar el texto intermedio y sustituir cada componente de forma independiente». Kyutai, laboratorio francés, tomó la misma decisión para Unmute: su reconocimiento de voz (stt-1b-en_fr, que entiende inglés y francés) y su voz se conectan a cualquier modelo de lenguaje, y el laboratorio escribe que «la principal fuerza de Unmute es su modularidad».
El precio es el tiempo, y lo que se pierde por el camino. Cada etapa espera a la anterior: Kyutai explica que, una vez detectado el final del habla, su sistema todavía tiene que esperar 500 milisegundos, el retraso de su reconocimiento de voz, antes de tener todo el texto. Y el texto no guarda el tono, la duda, el «sí» que quiere decir «no». Al teléfono, donde el reconocimiento de voz falla mucho más que en un estudio, un error de escritura se convierte en un error de comprensión.
El modelo único: de la voz a la voz
Un modelo speech-to-speech recibe sonido y responde con sonido, sin etapa escrita. Moshi, publicado por Kyutai en 2024 con pesos abiertos, es presentado por sus autores como el primer gran modelo de lenguaje hablado full-duplex en tiempo real: sigue su propia voz y la de su interlocutor en dos flujos paralelos, con una latencia teórica de 160 milisegundos, 200 en la práctica en una tarjeta gráfica L4. OpenAI ofrece una API «Realtime» que usa «un solo modelo para interpretar el audio, decidir qué hacer y responder hablando», y describe también una tercera vía: un modelo que escucha y habla a la vez y delega el razonamiento y las herramientas en un sistema aparte.
El precio es el inverso. Kyutai, que ha construido las dos, lo escribe: Moshi «todavía no iguala» a los modelos de texto en llamadas a herramientas, razonamiento y aprendizaje a partir de ejemplos. Y un modelo único solo habla los idiomas que aprendió, mientras que una cadena puede cambiar de reconocimiento de voz para cada idioma, o para cada variante, del español peninsular al mexicano.
Lo que gana y pierde cada uno
| Criterio | Cadena (pipeline) | Modelo único (speech-to-speech) |
|---|---|---|
| Retraso de respuesta | Las esperas se suman de una etapa a otra | Corto por construcción, sin etapa intermedia |
| Interrupciones | Las gestiona un detector aparte | El modelo escucha mientras habla, si es full-duplex |
| Control | Texto legible, respuesta verificable antes de decirla | Sin texto intermedio que releer |
| Herramientas, reglas de negocio | Las del modelo de lenguaje elegido | Por detrás, según Kyutai para Moshi |
| Idiomas | Un reconocimiento de voz por idioma, a elegir | Los del modelo, y solo esos |
| Tono, duda | Se pierden al escribir | Se conservan en el sonido |
Lo que miden los bancos de pruebas, y lo que no
Artificial Analysis clasifica los modelos speech-to-speech, junto con cadenas «por defecto» de varios proveedores, en razonamiento (Big Bench Audio: 1.000 preguntas en inglés, leídas por voces sintéticas), en pausas, turnos de palabra e interrupciones (Full Duplex Bench) y en tareas de atención al cliente (τ-Voice). Full-Duplex-Bench, publicado en marzo de 2025, propone una forma de medir esos comportamientos; Luqia construyó en 2026 versiones en francés, canadiense y europea, y señala que optimizar las cifras de un banco puede perjudicar la naturalidad de la conversación (véase los corpus en francés).
Ninguna de estas mediciones sale de una línea telefónica. Los 200 milisegundos de Moshi se miden en una tarjeta gráfica, no al otro lado de una llamada, y su códec de audio, Mimi, trata sonido muestreado a 24 kHz, el triple que los 8 kHz de una línea. En llamadas reales, OpenBenchmarks registra, para cinco plataformas del mercado, un tiempo hasta el primer sonido de 1,3 a 1,7 segundos (mediana). Estas cifras no miden lo mismo y no se comparan; recuerdan que una latencia de laboratorio no es una latencia de llamada (véase las cinco cifras que importan).
Dónde encaja ASDIC
ASDIC no es ni una cadena ni un modelo speech-to-speech: es un modelo de comprensión. No redacta respuestas ni habla. Debe escuchar la llamada y tomar las decisiones que sostienen una conversación: persona o contestador, ¿ha terminado la persona su frase?, ¿qué quiere?, ¿hay que pasar la llamada a un asesor? Esas preguntas se plantean sea cual sea la arquitectura que habla: en una cadena, un modelo así puede decidir sobre el sonido sin esperar al texto; junto a un modelo único, aporta decisiones separadas, que se pueden medir.
Es una elección de método, no un resultado. Los agentes de Nodical funcionan hoy en cadena, con un reconocimiento de voz y una voz suministrados por un proveedor estadounidense, y Nodical no tiene, a día de hoy, ningún modelo de comprensión propio. En las llamadas de septiembre de 2026, el agente responde en 0,14 segundos (mediana) una vez que ha decidido que la persona ha terminado, y en 1,32 segundos en 9 de cada 10 respuestas; ese retraso excluye la detección de fin de habla, que es precisamente lo que ASDIC debe aprender. Nuestro objetivo está escrito como objetivo: responder en menos de 0,5 segundos, interrumpiendo menos del 5 % de las veces. No está alcanzado; se publicará con la medición, en el cuaderno.
Lo que cambia durante la llamada
Para una empresa, la arquitectura importa menos que lo que permite hacer durante la llamada: agendar una cita, actualizar una ficha, avisar a un comercial. Esas acciones pasan por texto y por programas, justo donde, según reconoce la propia Kyutai, el modelo único sigue por detrás. La web de Nodical detalla los automatismos que Nodical activa durante la llamada.
¿Y en la práctica? los automatismos que Nodical activa durante la llamada
Fuentes
consultadas el 1 de octubre de 2026.
- Kyutai, « Unmute » (reconnaissance vocale et voix branchées sur n'importe quel modèle de langue ; comparaison avec Moshi) — https://kyutai.org/unmute
- Kyutai, « Kyutai STT » (délai de 500 ms de stt-1b-en_fr, VAD sémantique, « flush trick » d'Unmute) — https://kyutai.org/stt/
- Hugging Face, kyutai/stt-1b-en_fr (anglais et français, délai de 0,5 s) — https://huggingface.co/kyutai/stt-1b-en_fr
- arXiv 2410.00037, Kyutai, « Moshi: a speech-text foundation model for real-time dialogue » (2024) — https://arxiv.org/abs/2410.00037
- Kyutai, dépôt Moshi (latence de 160 ms théorique, 200 ms sur carte L4 ; codec Mimi à 24 kHz) — https://github.com/kyutai-labs/moshi
- OpenAI, « Voice agents » (documentation : GPT-Live, Realtime API, chaîne) — https://developers.openai.com/api/docs/guides/voice-agents
- OpenAI, « Realtime API » (documentation) — https://developers.openai.com/api/docs/guides/realtime
- Artificial Analysis, classement speech-to-speech (Big Bench Audio, Full Duplex Bench, τ-Voice, « Default Cascaded System ») — https://artificialanalysis.ai/speech-to-speech
- Artificial Analysis, jeu de données Big Bench Audio (1 000 questions, anglais, voix de synthèse) — https://huggingface.co/datasets/ArtificialAnalysis/big_bench_audio
- arXiv 2503.04721, « Full-Duplex-Bench: a benchmark to evaluate full-duplex spoken dialogue models on turn-taking capabilities » (mars 2025) — https://arxiv.org/abs/2503.04721
- arXiv 2609.10765, Luqia, « French Full-Duplex Benchmark » (EMNLP 2026 Industry) — https://arxiv.org/abs/2609.10765
- OpenBenchmarks, « Voice agent latency benchmark (2026), TTFAB from real phone calls » (dernier appel : 1er août 2026) — https://openbenchmarks.com/voice-agent-latency
- ASDIC, carnet n° 1 : « Septembre 2026 : première mesure » — https://asdic.ai/carnet/2026-09-premiere-mesure
Correcciones
Ninguna corrección hasta la fecha.