Speech to text en vietnamita para call centers: control de calidad
01/10/2026

En casi todos los call centers que he visto se repite la misma costumbre: el fin de semana, el supervisor escucha algunas llamadas al azar, las califica con una lista de criterios y le manda sus comentarios al agente. ¿Cuántas llamadas alcanza a escuchar? Muy pocas frente al volumen real. El resto se queda guardado, sin que nadie lo oiga. Por eso vale la pena considerar en serio el speech to text en vietnamita (reconocimiento de voz a texto): cuando las llamadas se vuelven texto, ustedes pueden buscar, contar y comparar en lugar de limitarse a escuchar.
Para qué sirve convertir las llamadas en texto
El primer beneficio, y el más evidente, es la cobertura. En vez de muestrear unas cuantas llamadas, tienen la transcripción de todas, y con reglas o modelos de lenguaje pueden filtrar las que vale la pena volver a escuchar. Por ejemplo: en qué llamada el cliente mencionó que quería cancelar el servicio, en cuál el agente se saltó el saludo estándar, en cuál la duración fue inusualmente larga.
El segundo es la revisión de cumplimiento. En los sectores con guiones obligatorios, como leer los términos y condiciones antes de cerrar un pedido, el texto permite comprobar si esa frase se dijo o no sin escuchar minuto a minuto. El tercero es la retroalimentación para el producto: las preguntas que los clientes repiten una y otra vez son información valiosa, y solo se vuelven visibles cuando se pueden leer miles de llamadas a la vez.
Un flujo de QA típico
- Grabar la llamada y separar los dos canales (cliente y agente) si la central telefónica lo permite.
- Convertirla en texto con un modelo de reconocimiento de voz.
- Etiquetar de forma automática: tema de la llamada, emoción, frases obligatorias.
- El supervisor escucha solo las llamadas señaladas y las contrasta con el texto.
Lo que quiero subrayar es el último paso. El texto no sustituye al supervisor: le ayuda a elegir qué llamadas conviene escuchar.
Por qué el vietnamita por teléfono es más difícil de lo que parece
Suena sencillo, pero el audio de una central telefónica es un tipo de dato complicado. La línea telefónica tradicional suele conservar solo un ancho de banda reducido, así que se pierden muchos detalles de las consonantes. En vietnamita, pares como "s" y "x", "ch" y "tr", o las consonantes finales "n", "ng" y "nh" ya se confunden con facilidad, y por teléfono se confunden todavía más.
Luego están los tonos. Los seis tonos son un rasgo propio del vietnamita, y un error de tono puede cambiar el sentido de toda la oración. Cuando el cliente llama desde un lugar con ruido, o habla encima del agente, el modelo tiene que inferir más a partir del contexto. Y falta sumar los acentos regionales, las palabras locales, los nombres propios, los números de pedido, los teléfonos dictados dígito por dígito y el inglés que se cuela a media frase ("cho em check lại cái order", algo así como "déjeme checar la orden").
Por eso siempre les recomiendo a los equipos de operaciones que no evalúen un sistema solo con una demo de voz limpia. Pruébenlo con su propio audio, en las horas pico, con los agentes que hablan más rápido. En AIVISION nos enfocamos en el vietnamita justamente por estas diferencias: el modelo de speech to text E1.0 se lanzó para vietnamita, y nuestra línea de diseño es dar prioridad a datos de voz reales y no solo a lecturas grabadas en estudio. Aquí no doy cifras de precisión, porque esa cifra solo significa algo cuando se mide con los datos de ustedes.
Las limitaciones, dichas sin rodeos
La transcripción automática tendrá errores. Es inevitable, y lo importante es saber dónde están para diseñar el proceso alrededor de ellos. Algunos casos frecuentes:
- Números y códigos: teléfonos, guías de envío y montos son donde más se falla y donde más cuesta el error. Conviene un paso de validación aparte y no confiar del todo en el texto.
- Nombres propios y términos internos: nombres de productos, de planes, de sucursales. Un diccionario personalizado o el fine-tuning ayudan bastante.
- Voces encimadas: si dos personas hablan al mismo tiempo, hasta a un oyente humano le cuesta, y más a una máquina.
- Emoción: el texto pierde la entonación. Un "sí, ya entendí" puede ser cortesía o puede ser sarcasmo, y las letras no lo dicen.
Hay una trampa que he visto varias veces: el equipo de QA califica a los agentes directamente con el texto automático, y a algún agente le bajan puntos por un error de la máquina. Eso destruye la confianza muy rápido. Es más seguro usar el texto para sugerir y clasificar, y que la calificación final la confirme una persona en las llamadas importantes.
Datos y privacidad
Las llamadas contienen datos personales: nombre, domicilio y, en ocasiones, hasta números de cuenta. Antes de implementar, conviene responder algunas preguntas prácticas. ¿Dónde se procesa el audio, en servidores de ustedes o del proveedor? ¿Cuánto tiempo se conserva el texto? ¿Se ocultan los datos sensibles antes del análisis? ¿Se avisa al cliente que la llamada se graba? Estas preguntas no son atractivas, pero deciden si el proyecto pasa o no la revisión del área legal.
Cómo empezar en pequeño y con buenos resultados
No intenten digitalizarlo todo de golpe. Elijan un grupo de llamadas con guion claro, por ejemplo confirmación de pedidos o quejas, tomen unos cientos, conviértanlas en texto y pidan a los supervisores que lo comparen con lo que escucharon ellos mismos. Muy pronto les dirán dónde falla el sistema y si es lo bastante confiable para seguir adelante. A partir de ahí se decide si hace falta hacer fine-tuning con el vocabulario propio de la empresa.
Si su equipo está evaluando este camino, pueden conocer más sobre los modelos en vietnamita que desarrolla AIVISION. Un buen sistema de QA no empieza por la tecnología, empieza por lo que ustedes quieren saber de sus llamadas.