AIVISION lanza IA Speech-to-Speech: gratis, en tiempo real y on-premise
02/10/2026

Usted dice una frase y, un instante después, la IA le responde con su propia voz. Sin teclear, sin leer texto en una pantalla. Eso es lo que AIVISION acaba de lanzar: un conjunto de modelos Speech-to-Speech para vietnamita, gratis para probar en s2speech.com, que funcionan en tiempo real y se pueden instalar on-premise dentro de la infraestructura de la empresa.

Qué es Speech-to-Speech, en palabras sencillas
Un sistema de conversación por voz tiene que hacer tres cosas seguidas: escuchar (convertir la voz en texto), entender (un modelo de lenguaje prepara la respuesta) y hablar (leer la respuesta en voz alta). Cuando esos tres pasos vienen de tres proveedores distintos, los retrasos se acumulan y la experiencia se siente cortada. El Speech-to-Speech de AIVISION reúne los tres: Speech-to-Text, el modelo de lenguaje aivision-L1.0 y Text-to-Speech, en una sola plataforma y una sola API.
El resultado es una conversación más fluida. El audio se transmite por streaming, así que quien escucha empieza a oír la respuesta antes de que termine de leerse completa.
Cuatro puntos clave del lanzamiento
- Uso gratuito: cada cuenta en s2speech.com tiene $5 de uso gratis al día, sin tarjeta.
- Tiempo real: escucha, entiende y responde mientras la conversación está ocurriendo.
- On-premise: las empresas pueden correr todo el sistema en sus propios servidores, sin que los datos de voz salgan de su infraestructura.
- Hardware moderado: basta una GPU con unos 8GB de VRAM, del nivel de una RTX 2080 Ti, y atiende 8 conversaciones simultáneas (8 CCU).
Por qué importa que funcione en una GPU de 8GB
Muchas empresas quieren IA de voz pero chocan con dos obstáculos: no quieren enviar grabaciones de clientes a un servicio externo y no tienen presupuesto para un clúster de GPU costoso. Un modelo que necesita solo unos 8GB de VRAM cambia esa ecuación. Un servidor con una tarjeta gráfica común alcanza para empezar, y la capacidad crece agregando equipos, a razón de unas 8 sesiones por GPU.
Además, on-premise mantiene los datos de las conversaciones bajo control de la empresa, algo que sectores como la banca, la salud o el sector público suelen exigir.
Para qué sirve
Centros de llamadas y atención al cliente
Responder preguntas repetitivas con una voz natural, fuera de horario o cuando las líneas están saturadas. La plataforma admite audio G.711 a 8 kHz que se reproduce directamente en los conmutadores telefónicos más comunes.
Asistentes de voz dentro de aplicaciones
Agregar preguntas y respuestas habladas a una app, un kiosco o un dispositivo sin tener que unir varios servicios por separado.
Interpretación y conversación multilingüe
En s2speech.com ya hay aplicaciones listas para usar, como interpretación de voz, subtítulos en vivo y salas de reunión multilingües. Según AIVISION, las aplicaciones de traducción y reuniones admiten 24 idiomas, incluido el español, con el vietnamita como eje.
Precisión publicada con números
Escuchar es la base del Speech-to-Speech. AIVISION reporta una tasa de error de palabras promedio de 11,84% para su modelo de reconocimiento de voz en cuatro conjuntos de prueba en vietnamita, incluidas conversaciones médicas y reuniones reales de empresa. Son cifras internas de AIVISION, medidas con datos que no se usaron para entrenar, y publicadas en s2speech.com.
Cada entorno real es distinto, con su propio ruido, acentos y vocabulario técnico, así que la mejor prueba sigue siendo un piloto con sus propios datos antes de un despliegue amplio.
Cómo empezar
Regístrese y pruébelo ahora en s2speech.com. Los desarrolladores pueden integrarlo por REST y WebSocket, y el modelo de lenguaje usa una API compatible con OpenAI.
Para instalación on-premise o consultas de negocio, contacte a:
- Teléfono: +84 981 419 967
- Correo: giang.vo@aivgroups.com
Conozca más soluciones de IA de AIVISION en AIVISION.