¿Qué es Speech-to-Speech? Voicebots que escuchan, piensan y responden

05/10/2026

¿Qué es Speech-to-Speech? Voicebots que escuchan, piensan y responden

Imaginen esto: son las nueve de la noche y el minisplit de la recámara de la señora Lan empieza a gotear. Llama a la línea de servicio. El personal ya se fue, así que contesta una grabación: marque 1 para agendar una visita, marque 2 para hablar con un técnico, marque 0 para repetir las opciones. Marca 1, escucha otro menú y cuelga. Mañana será.

AIVISION solution demo
Video corto: s2speech

Ahora repitan la misma llamada con un sistema Speech-to-Speech del otro lado. La señora Lan solo dice: “Mi minisplit está goteando, ¿puede venir alguien mañana en la tarde?”. La voz en la línea le pide la dirección, acuerda un horario y le repite su número de teléfono para que lo confirme. Sin teclas, sin música de espera. Suena a película, pero detrás solo hay tres tareas muy cotidianas.

Escuchar, pensar, hablar: las tres tareas de un voicebot

En el fondo, un voicebot Speech-to-Speech hace justo lo que un agente de call center hace todo el día, solo que sin cansarse.

  • Escuchar: convertir la voz en texto (Speech-to-Text). En la plataforma s2speech este paso funciona en streaming por WebSocket, así que las palabras aparecen mientras la persona todavía está hablando. Está hecho para entender vietnamita mezclado con inglés, números, dinero, fechas y distintos acentos regionales.
  • Pensar: un modelo de lenguaje lee lo que se acaba de decir, identifica la intención y redacta la respuesta. Aquí ese modelo es aivision-L1.0, el LLM en vietnamita de AIVISION, que responde en streaming en lugar de esperar a terminar todo el párrafo.
  • Hablar: convertir la respuesta en voz (Text-to-Speech), con voces naturales en vietnamita o en inglés que empiezan a sonar desde las primeras palabras.

La palabra que más importa aquí es “streaming”. Si las tres etapas hacen fila y cada una espera a que la anterior termine por completo, quien llama escucha un silencio largo después de cada frase. Cuando las tres corren encadenadas, la respuesta empieza a sonar mientras su final todavía se está pensando. Ahí la llamada empieza a sentirse como una plática con una persona.

Por qué unos segundos de silencio salen tan caros

En un chat, el cliente espera. Por teléfono, no. Bastan unos segundos sin respuesta para que la gente empiece con el “¿bueno?, ¿bueno?” y hable encima del bot, y desde ahí la llamada se enreda. Por eso, cuando ustedes evalúen un sistema de IA de voz, no pregunten solo si responde bien. Pregunten si responde a tiempo.

Algunas pruebas que solemos recomendar en plena demo, antes de que alguien abra la presentación:

  • Interrúmpanlo a media frase. Un voicebot decente debe callarse y escuchar, en lugar de seguir de largo como una grabadora.
  • Díctenle una dirección con número de casa y de callejón, luego un monto y una fecha concreta. Los sistemas débiles suelen fallar justo aquí.
  • Hablen como oficinistas en Vietnam, que meten inglés en cada frase: “check giùm em cái voucher” (revísame ese cupón) o “book lại slot chiều mai” (reagenda el horario de mañana en la tarde).
  • Cambien de persona: acentos del norte, del centro y del sur, gente que habla rápido, gente que titubea mucho.

Cómo leer las cifras de precisión con la cabeza fría

AIVISION publica una tasa de error por palabra (WER, entre más baja, mejor) de 11.84% en promedio sobre cuatro conjuntos de prueba en vietnamita. El desglose es lo que vale la pena leer: 4.58% en FLEURS-vi (voz leída); 6.83% en VIVOS; 15.68% en ViMedCSS (ámbito médico); y 20.29% en juntas de negocios reales. Son cifras internas, medidas con datos que no se usaron para entrenar.

Ese 20.29% merece estar pegado en la pared, no escondido, porque dice la verdad sobre la vida real: entre más desordenado el audio, más gente hablando al mismo tiempo y más jerga técnica, más fácil es que la máquina escuche mal. La lección de diseño es muy práctica: números de teléfono, montos y fechas de cita siempre deben repetirse para que el cliente los confirme. No apuesten todo a escuchar una sola vez.

Qué darle al voicebot y qué dejarle a las personas

Los voicebots funcionan muy bien en llamadas repetitivas y con estructura: agendar y reprogramar citas, consultar el estado de un pedido, confirmar entregas, enviar recordatorios, responder preguntas frecuentes y cubrir líneas fuera de horario para registrar solicitudes. También sirven muy bien de recepcionistas: recogen algunos datos y pasan la llamada a la persona correcta, para que el equipo no tenga que empezar desde cero.

En cambio, hay llamadas que le tocan a una persona. Un cliente molesto porque el mismo producto se descompuso por tercera vez. Una negociación de precio. Cualquier tema de finanzas, seguros o salud, donde la IA debe ayudar a consultar y tomar notas, mientras las decisiones las toman personas. Nuestra postura es sencilla: un buen voicebot no es el que se las sabe todas, sino el que sabe cuándo transferir la llamada.

Empiecen en pequeño y midan con llamadas reales

La forma más sencilla de probar es elegir un solo tipo de llamada, escuchar unas cuantas decenas de grabaciones reales y escribir el guion también para los momentos en que el cliente se sale del guion. La tecnología puede esperar.

Cuando llegue el momento de elegir, hay dos caminos. Uno es armar las tres etapas por API: Speech-to-Text, Text-to-Speech y aivision-L1.0 comparten una cuenta, una API key y un saldo, y, según s2speech.com, por ahora cada cuenta tiene 10 dólares de uso gratis al día, sin tarjeta. El otro es usar la versión empaquetada de Speech-to-Speech: gratuita, en tiempo real, instalable on-premise en una sola GPU de unos 8 GB de VRAM (tipo RTX 2080 Ti) y con capacidad para 8 sesiones simultáneas. El panorama completo de servicios está en la página de s2speech de AIVISION, y si prefieren hablarle de una vez, entren directo a s2speech.com.

Sea cual sea el camino, dejen que los datos de llamadas reales hablen: cuántas llamadas terminan sin un humano, cuántas se transfieren y en qué frase cuelga la gente. Si la señora Lan logra agendar al técnico en una sola llamada, sin volver a marcar a la mañana siguiente, el voicebot hizo su trabajo.

Artículos relacionados

Ver todos los artículos