de Nodical

ASDIC es un proyecto de investigación 2027-2028. Las mediciones publicadas son las del cuaderno; los objetivos son objetivos.

Saber

Evaluar a un proveedor de voz IA: diez preguntas

Publicado el Por Douglas DemartEstado del proyecto a 1 de octubre de 2026

En una frase

Una ficha comercial da una cifra; diez preguntas sencillas dicen lo que vale —con qué audio, en qué idioma, por qué línea, en mediana o en el peor caso, medida por quién— y qué pasa con la voz de las personas llamadas, dónde, durante cuánto tiempo, y cuando todo se para.

Por qué preguntas y no una clasificación

Ninguna clasificación dice qué agente de voz servirá para sus llamadas. Las cifras publicadas suelen ser exactas, pero medidas en otro sitio: otro audio, otro idioma, otra línea. Coval, una empresa que vende herramientas de evaluación de agentes de voz, lo escribió sin rodeos en junio de 2026: los bancos de pruebas de los proveedores son «textos publicitarios con mediciones adjuntas»; las cifras son reales, las condiciones se eligen para favorecer. Ordena sus objeciones en tres preguntas: en qué condiciones, medido cómo, comparado con qué. Aquí las desglosamos en diez. Ninguna exige ser ingeniero; todas piden una respuesta escrita, con nombres. Esta página no recomienda ningún producto: compara respuestas, no marcas.

Cinco preguntas sobre la medición

1. ¿Con qué audio han medido?

¿Libros leídos, vídeos, reuniones o llamadas reales? Coval recuerda que los conjuntos de prueba estándar no reflejan «ni sus guiones, ni sus llamantes, ni sus acentos». Una buena respuesta nombra el conjunto de prueba, da su tamaño y dice si se parece a sus llamadas: salientes o entrantes, cortas o largas. «En condiciones reales», sin más detalle, no es una respuesta.

2. ¿En qué idioma?

Una cifra en inglés no dice nada del español. Según el artículo que la describe (octubre de 2025), el Open ASR Leaderboard, la clasificación pública más usada en reconocimiento de voz, evalúa el español con tres conjuntos de habla leída: CoVoST-2, FLEURS y MLS. Pida la cifra en su idioma y, si sus clientes tienen acentos variados —andaluz, canario, rioplatense, mexicano—, con esos acentos.

3. ¿Por teléfono (8 kHz) o en banda ancha?

Una línea telefónica solo transmite las frecuencias de 300 a 3.400 hercios, muestreadas a 8 kilohercios. La diferencia no es un detalle: en el artículo que presenta Whisper, el mismo modelo comete un 2,7 % de palabras erróneas con audiolibros leídos y un 17,6 % con CallHome, un corpus de llamadas telefónicas en inglés. Pida una cifra medida con sonido de línea (vea Audio a 8 kHz: lo que los modelos no oyen).

4. ¿La mediana, y el p95?

La mediana dice lo que vive una llamada normal; el p95, el valor por debajo del cual quedan 95 mediciones de cada 100, dice lo que viven quienes más esperan. Coval llama a una latencia mediana medida en condiciones ideales «una cifra de marketing». OpenBenchmarks, que cronometra el retraso de respuesta de cinco plataformas en llamadas telefónicas reales, publica ambas: en agosto de 2026, medianas de 1,3 a 1,7 segundos y p95 de 1,8 a 2,3 segundos. Pregunte también qué se cronometra, y desde cuándo hasta cuándo (vea Medir un agente de voz: las cinco cifras que importan).

5. ¿Quién midió: ustedes o un tercero?

Una medición hecha por el proveedor con su propio conjunto de prueba no es falsa; no es verificable. ¿La ha repetido un tercero? ¿Es público el método, como los de OpenBenchmarks y el Open ASR Leaderboard, que publican su código? ¿Se repite cuando cambia el modelo? Coval señala actualizaciones impuestas por los proveedores sin cambio de número de versión. Lo más seguro sigue siendo medir con una muestra de sus propias llamadas (vea Leer un benchmark de reconocimiento de voz sin dejarse engañar).

Cuatro preguntas sobre los datos

6. ¿Por dónde pasa el audio?

Operador telefónico, reconocimiento de voz, modelo de lenguaje, síntesis de voz, almacenamiento: la voz de una persona llamada atraviesa varios servicios. Pida, para cada uno, la empresa y el país. «Alojado en Europa» puede referirse solo a la base de datos (vea IA soberana: qué significa para una conversación telefónica).

7. ¿Cuánto tiempo se guarda?

Grabaciones, transcripciones, resúmenes: cada uno tiene su plazo. Para la grabación de llamadas, la CNIL, autoridad francesa de protección de datos, indica que la conservación varía según el objetivo perseguido; para la prueba de un contrato, recuerda que el plazo de prescripción ordinario en Francia es de cinco años. Una respuesta seria da un plazo por uso, dice qué ocurre al final (supresión o anonimización) y precisa si sus llamadas sirven para entrenar los modelos del proveedor.

8. ¿Quiénes son sus encargados del tratamiento?

El RGPD (artículo 28) prohíbe a un encargado recurrir a otro sin la autorización por escrito del responsable del tratamiento, y le obliga a avisar de cualquier cambio para que pueda oponerse. Pida la lista con nombres, con el país y la función de cada uno. Una lista publicada vale más que una lista «disponible bajo petición».

9. ¿Cómo se opone una persona llamada?

No le corresponde a la persona llamada averiguar cómo decir que no. La CNIL exige una mención oral, al inicio de la conversación, que anuncie la grabación y su finalidad e informe de la posibilidad de oponerse. Desde el 2 de agosto de 2026, el Reglamento europeo de IA (artículo 50) exige además que la persona sepa que habla con una IA. Pregunte qué dice el agente en los primeros segundos, qué pasa si la persona se niega, y cómo se excluye después su número.

Una pregunta sobre las caídas

10. ¿Qué pasa si algo se cae?

Si falla un eslabón de la cadena, ¿qué pasa con la llamada en curso? ¿El agente se calla, cuelga, pasa la llamada a una persona o a otro proveedor? ¿Qué pasa con las llamadas programadas, y a quién se avisa? Pida el relato de una caída pasada. Un proveedor que nunca ha tenido una caída no existe; uno que sabe contar la suya, sí.

Las respuestas que deben hacer sospechar

  • Una tasa de precisión sin conjunto de prueba, sin idioma y sin calidad de línea.
  • Una sola «latencia», sin decir qué se cronometra ni dar un p95.
  • «Alojado en Europa» sin lista de encargados.
  • «Conforme al RGPD» como respuesta a una pregunta precisa.
  • Nada por escrito sobre lo que pasa en caso de caída.

Ninguna de estas respuestas demuestra que un producto sea malo. Solo demuestran que aún no se sabe si es bueno.

Nuestras propias respuestas, en cuanto a la medición

Nos hacemos las mismas preguntas. ¿Qué audio? Nuestras llamadas de producción: en septiembre de 2026, 60.287 llamadas atendidas por una persona, 14 campañas, en francés, medidas sin leer el contenido de las conversaciones. Aún no hemos hecho ninguna llamada en español, así que no hay cifra en español. ¿Mediana y valor alto? El contestador se reconoce a los 8 segundos (mediana) y a los 14 segundos en 9 de cada 10 llamadas. ¿Quién midió? Solo nosotros: ningún tercero ha repetido la medición. ¿Qué parte de la cadena es nuestra? Hoy, ningún modelo de comprensión propio —0 %—; la voz y el reconocimiento de voz descansan en un proveedor estadounidense, nombrado con los demás encargados en la política de privacidad de Nodical. El detalle está en la entrada n.º 1 del cuaderno.

Lo que Nodical responde a estas diez preguntas

Las últimas preguntas tocan más al servicio que a la investigación: cómo se factura una llamada, cuándo pasa el agente la llamada a una persona, qué rastro queda de cada llamada, cómo se deja el servicio. Nodical publica su respuesta comparando punto por punto un centro de llamadas y un agente de voz: lo que Nodical responde a estas diez preguntas.

¿Y en la práctica? lo que Nodical responde a estas diez preguntas

Fuentes

consultadas el 1 de octubre de 2026.

  1. Coval, « Best STT providers 2026: independent benchmarks and how to choose » (4 juin 2026) — https://www.coval.ai/blog/best-speech-to-text-providers-in-2026-independent-benchmarks-and-how-to-choose/
  2. OpenBenchmarks, « Voice agent latency benchmark (2026), TTFAB from real phone calls » (dernier appel : 1er août 2026) — https://openbenchmarks.com/voice-agent-latency
  3. arXiv 2510.06961, « Open ASR Leaderboard » (jeux de test, octobre 2025) — https://arxiv.org/html/2510.06961v1
  4. OpenAI, « Robust Speech Recognition via Large-Scale Weak Supervision » (article Whisper, tableau 8) — https://cdn.openai.com/papers/whisper.pdf
  5. CNIL, « L'enregistrement des conversations téléphoniques afin d'établir la preuve de la formation d'un contrat » — https://www.cnil.fr/fr/lenregistrement-des-conversations-telephoniques-afin-detablir-la-preuve-de-la-formation-dun-contrat
  6. Règlement (UE) 2016/679 (RGPD), article 28 (sous-traitant) — https://gdpr-info.eu/art-28-gdpr/
  7. AI Act, article 50 (transparence : informer la personne qu'elle parle à une IA), applicable au 2 août 2026 — https://artificialintelligenceact.eu/article/50/
  8. Nodical, politique de confidentialité (liste des sous-traitants) — https://nodical.ai/confidentialite

Correcciones

Ninguna corrección hasta la fecha.