Reconocimiento de voz en vietnamita: acentos, ruido y términos

01/10/2026

Reconocimiento de voz en vietnamita: acentos, ruido y términos

Una persona de Nghệ An dice: «mô tê răng rứa». Una persona de Saigón dice: «sao vậy trời». Las dos hablan vietnamita y para quien escucha no tiene nada de raro, pero para un sistema de reconocimiento de voz en vietnamita son dos problemas muy distintos. En AIVISION desarrollamos el modelo de voz a texto (speech to text) E1.0 y hemos visto muchos tipos de error; este artículo cuenta los tres grupos de dificultades más grandes, con la opinión de quienes lo vivimos de cerca.

Acentos regionales: un idioma, varios sistemas de sonidos

El vietnamita tiene seis tonos, y la pronunciación de esos tonos varía según la región. En muchas zonas del centro del país, ciertos tonos (hỏi, ngã o nặng) suenan muy distintos al estándar del norte o del sur. Las consonantes iniciales también cambian: en algunos lugares se distingue entre tr y ch, entre s y x, y en otros no. En unas regiones d, gi y r suenan casi igual; en otras se mantienen como tres sonidos diferentes.

Para una persona, el contexto ayuda a compensar. Se oye un sonido y la palabra se adivina por el sentido de la oración. Para una máquina, si los datos de entrenamiento son sobre todo de un solo acento, los demás tendrán una tasa de error más alta. No es una falla del algoritmo, sino de la diversidad de los datos.

La verdadera dificultad es recopilar datos de los acentos menos comunes. Se necesitan hablantes reales, grabaciones reales y gente que escuche y transcriba palabra por palabra. Este proceso es caro, lento y tiende a sesgarse hacia las regiones más accesibles. No afirmamos que E1.0 ya maneje todos los acentos, porque no existe una medición pública que permita decirlo. Es una línea de mejora continua.

Hay algo más: una persona no tiene un solo acento. La misma persona habla distinto en una charla informal que en un discurso formal, y distinto cuando está cansada que cuando está despierta. Muchos vietnamitas que viven lejos de su tierra mezclan su acento de origen con el del lugar donde viven, y resulta una variedad híbrida que ninguna clasificación regional logra abarcar.

El ruido: el aguafiestas fuera del laboratorio

La mayoría de los modelos de reconocimiento de voz se ven bien en condiciones limpias. Los problemas empiezan en el mundo real. Una moto que pasa, el ventilador, el aire acondicionado, el ruido de platos en un restaurante, otra persona que interrumpe. En vietnamita, el ruido es especialmente dañino porque muchas distinciones importantes están en pequeños detalles del sonido, como el final de un tono o la consonante final. Cuando esos detalles quedan tapados, dos palabras con significados distintos se vuelven una sola.

Una situación frecuente para el equipo de producto: el usuario graba con el celular sobre la mesa de juntas, a tres o cuatro metros de quien habla. El sonido rebota en las paredes y la voz de quien está cerca tapa la de quien está lejos. El resultado es malo no porque el modelo sea malo, sino porque la señal ya llegó dañada. A veces el consejo más eficaz es muy cotidiano: acercar el micrófono a quien habla.

También hay ocasiones en que la reducción de ruido previa al reconocimiento empeora el resultado. Un filtro demasiado agresivo puede borrar los pequeños detalles de la voz. Es un compromiso sutil en el que pocas personas ajenas al sector piensan.

Términos especializados y nombres propios

Este es el grupo de errores que más molesta a los usuarios, porque se equivocan justo en las palabras más importantes. Una junta puede reconocerse casi a la perfección, salvo el nombre del cliente, el nombre del proyecto y unas cuantas siglas internas.

La razón es fácil de entender: esas palabras son raras en los datos de entrenamiento. El modelo está acostumbrado al habla común y tiende a sustituir una palabra desconocida por una conocida que suene parecida. El nombre de un principio activo, de un trámite legal o de una pieza técnica puede convertirse en palabras comunes que se le parecen.

Tomemos como ejemplo el sector farmacéutico. Los nombres de medicamentos suelen ser largos, de origen extranjero y con pronunciaciones adaptadas al vietnamita que no son uniformes: uno lo dice a la inglesa, otro a la francesa, un tercero como se acostumbra en la farmacia. Un sistema de reconocimiento tiene que enfrentarse a todas esas formas de decirlo. Esta es justamente la razón por la que insistimos en que, en salud y farmacia, el voz a texto solo debe apoyar el registro administrativo, y todo el contenido debe ser revisado por una persona con formación. El sistema no diagnostica, no receta y no recomienda dosis.

Las estrategias más habituales incluyen:

  • Agregar vocabulario del sector a los datos de entrenamiento o al fine-tuning.
  • Usar un modelo de lenguaje posterior que corrija errores según el contexto, por ejemplo un LLM en vietnamita que relea la transcripción y ajuste lo que no tiene sentido.
  • Permitir que el usuario proporcione una lista de nombres propios y términos que deben priorizarse.

Ninguna de estas es una solución mágica y cada una tiene su costo. Usar un LLM para corregir puede dejar el texto más pulido, pero alejado de lo que la persona realmente dijo, un riesgo que hay que considerar con seriedad cuando la transcripción se usa como documento.

Dificultades de las que se habla poco

Además de los tres grupos grandes, hay otras cosas que le complican la vida al equipo. Los vietnamitas suelen mezclar inglés en medio de la oración: deadline, meeting, feedback, incluso nombres de productos tecnológicos. La frontera entre vietnamita e inglés dentro de una misma frase es algo que un sistema de reconocimiento de un solo idioma maneja muy mal. Está también la normalización del texto: se dice «dos mil doscientos», pero ¿se escribe 2.200 o 2200? ¿Cómo se escriben las fechas? No tenemos una única respuesta, porque cada lugar de uso tiene sus propias convenciones.

Un problema parecido existe en los mercados que le interesan a AIVISION, como México o Filipinas, donde la gente suele mezclar idiomas en una misma oración. La lección general es esta: ningún modelo resuelve todo, y saber con claridad en qué falla un modelo es tan importante como lograr que acierte más.

Artículos relacionados

Ver todos los artículos