Crear una app de voz en vietnamita: STT, LLM y TTS con una API key
05/10/2026

El pedido suena sencillo: el cliente abre la app, dice algo como “¿puedo pasar mañana a las ocho para un cambio de aceite?”, y la app entiende, aparta el lugar y contesta en voz alta. Sin formularios, sin menús desplegables. Supongamos que en una pequeña cadena de talleres de motos en Vietnam hay un solo desarrollador y ese pedido le acaba de caer en el escritorio. Suena a proyectazo, pero una app de voz en vietnamita como esta en realidad son tres llamadas a API encadenadas: escuchar, pensar, hablar.

Lo que facilita esto en s2speech es que las tres etapas viven bajo una sola cuenta, una API key y un saldo: Speech-to-Text, el modelo de lenguaje aivision-L1.0 y Text-to-Speech. Un solo lugar para gestionar accesos y uno solo para vigilar costos. Lo que sigue es la ruta que le sugeriríamos a quien va a escribir el código, con opiniones incluidas y no solo una lista de funciones.
Antes de escribir una sola línea de código
Salgan a grabar. No su propia voz leyendo en voz alta frente a la compu, sino clientes reales: el que habla rapidísimo, el señor mayor que titubea, la oficinista que mete “book” y “confirm” a media frase en vietnamita, gente del centro del país y del delta del Mekong. Junten unas cuantas decenas de frases así en un pequeño set de pruebas. Cada decisión que venga después, desde cómo escuchar hasta cómo escribir el prompt, debería validarse contra ese set.
Después creen una cuenta y obtengan su API key. Según s2speech.com, por ahora cada cuenta incluye 10 dólares de uso gratis al día, sin tarjeta, así que la etapa de pruebas puede arrancar de inmediato sin recargar saldo. Cuando sí necesiten saldo, la recarga es por transferencia bancaria, desde 50,000 VND.
Escuchar: ¿streaming o archivo?
El Speech-to-Text de s2speech tiene dos puertas. Entrar por la equivocada explica muchas apps que “funcionan, pero se sienten lentas”.
- Streaming por WebSocket para conversaciones en vivo. El audio sube en pedacitos y el texto regresa mientras la persona todavía está hablando. Úsenlo cuando la app tenga que reaccionar al instante, como un asistente de citas.
- REST para archivos o URL cuando los usuarios mandan notas de voz o cuando procesan grabaciones después de una llamada. Es más simple y más fácil de reintentar cuando se cae la red.
Un detalle que se pasa por alto: los resultados traen marcas de tiempo por palabra. Sirven más de lo que parece, desde resaltar en los subtítulos la palabra que se está diciendo hasta brincar justo al momento en que el cliente dijo “cambiar la cita”. El STT también está hecho para entender vietnamita mezclado con inglés, números, dinero, fechas y distintos acentos regionales. Pero no le crean a nadie, ni siquiera a nosotros: corran su propio set de pruebas y revisen los resultados con sus propios ojos.
Pensar: denle un marco al modelo
aivision-L1.0 tiene una API compatible con OpenAI. Si ustedes ya usan una librería cliente conocida en su backend, la mayor parte del trabajo es cambiar la base URL, la API key y el nombre del modelo. El modelo resume, responde preguntas, redacta minutas, traduce y analiza conversaciones, soporta streaming y funciona en vietnamita y en inglés.
En una app de citas, no dejen que el modelo platique a sus anchas. Unas cuantas reglas evitan que todo se desvíe:
- Un system prompt corto y concreto: en qué horario abre el taller, qué servicios ofrece y cuándo debe volver a preguntarle al cliente.
- Pídanle al modelo dos cosas: datos estructurados (servicio, fecha, hora) para la lógica de la cita y una frase corta para leérsela al cliente. Que el backend valide esos datos antes de tocar la agenda real.
- Activen el streaming para que la respuesta pase a la etapa de voz en cuanto estén listas las primeras palabras.
- Respuestas cortas. Escuchar no es leer: tres frases largas en pantalla están bien; por la bocina del celular, el cliente ya olvidó la del principio.
Hablar: una voz que arranca desde las primeras palabras
El Text-to-Speech de s2speech ofrece voces naturales en vietnamita y en inglés que se transmiten desde las primeras palabras. Junto con el streaming del modelo, el cliente escucha la respuesta mientras el final todavía se está generando. Si algún día la app se conecta a un conmutador, ya existe salida de 8 kHz G.711 μ-law/A-law para Asterisk y FreeSWITCH. Y la clonación de voz a partir de 20 segundos a 2 minutos de grabación solo se hace con el consentimiento de la persona dueña de esa voz. Es una condición, no una opción.
Tres errores clásicos del primer demo
- Meter la API key dentro de la app móvil. No lo hagan. La key vive en su backend y la app solo habla con su servidor. Una key filtrada convierte su saldo en el de alguien más.
- No repetir los datos importantes. “Entonces queda mañana a las ocho, cambio de aceite, ¿correcto?” Una frase de confirmación sale muchísimo más barata que un cliente que llega a la hora equivocada.
- Probar solo en una oficina con aire acondicionado. Salgan a la banqueta, prendan un ventilador, pongan música. Según las cifras internas que publica AIVISION, la tasa de error por palabra promedio en cuatro conjuntos de prueba en vietnamita es de 11.84%, desde 4.58% con voz leída en FLEURS-vi hasta 20.29% en juntas de negocios reales. Entre más caótico el entorno, más hay que diseñar la app para corregir errores.
La lista de servicios y apps listas para usar está en la página de s2speech en aivision.mx; para crear una cuenta, sacar una key y empezar a probar, vayan a s2speech.com. Y si lo único que necesitan es grabar, transcribir y sacar minutas sin programar todavía, AI Voice Note es una app lista que hace justo eso, con preguntas y respuestas sobre lo grabado.
¿Y el taller? La versión uno no necesita ser brillante. Solo tiene que escuchar bien la hora de la cita, preguntar de nuevo cuando no esté segura y nunca prometer un cambio de aceite cuando el taller ya cerró.