Por qué un LLM en vietnamita necesita entrenamiento propio
01/10/2026

Una tarde, un amigo que trabaja en atención a clientes me mandó una captura de pantalla. El cliente había escrito: 'em oi cho anh hoi cai nay bao hanh may thang' (en vietnamita y sin acentos, algo como «oye, una pregunta, ¿de cuántos meses es la garantía de esto?»). El chatbot respondió con un párrafo muy cortés, muy fluido y totalmente fuera de lugar, porque interpretó 'bao hanh' como otra cosa. Nadie en la oficina pudo reírse. Es el tipo de error pequeño que solo aparece cuando algo se despliega de verdad, y es la razón principal por la que en AIVISION nos tomamos en serio un LLM en vietnamita entrenado de forma específica.
Para ser justos: los grandes modelos multilingües de hoy leen y escriben vietnamita bastante bien. Muchas tareas no necesitan un modelo propio. Pero «bastante bien» y «lo bastante confiable para ponerlo frente a un cliente» son dos distancias muy distintas, y esa brecha se concentra en cuatro puntos concretos.
Tokenizer: el costo está donde casi nadie mira
El modelo no lee letras, lee tokens. El tokenizer se construye a partir del corpus de entrenamiento inicial, y si ese corpus es mayormente en inglés, los fragmentos en inglés se agrupan de forma compacta mientras que el vietnamita queda hecho pedazos. Una oración en vietnamita con acentos puede costar bastantes más tokens que su equivalente en inglés. No damos una cifra aquí porque depende de cada tokenizer, pero ustedes mismos pueden medirlo en cinco minutos: tomen el mismo párrafo en dos idiomas, cuenten los tokens y comparen.
Las consecuencias son de tres tipos. Sube el costo de las llamadas a la API, porque se cobra por token. La ventana de contexto se encoge, así que caben menos documentos largos. Y la generación se vuelve más lenta, porque cada sílaba puede requerir varios pasos. Un entrenamiento propio permite elegir o ampliar el vocabulario para que sílabas frecuentes como 'không', 'được' o 'người' sean un solo token completo y no tres o cuatro fragmentos. El inconveniente es que hay que reentrenar la parte de embeddings, y si se hace a la ligera, el modelo puede perder parte de lo que ya sabía.
Datos: más no significa más limpio
Hay bastante vietnamita en la web, pero gran parte son noticias copiadas, comentarios, publicidad, contenido traducido por máquina sin revisar y páginas de spam. Un modelo que aprende de ahí aprende también el tono torpe de la traducción automática. ¿Les ha pasado leer un texto en español y notar de inmediato que es una traducción del inglés? Cada palabra es correcta, pero nadie hablaría así. El modelo también produce textos de ese tipo, porque ha leído muchísimos.
La carencia más grande está en los campos especializados: documentos administrativos, textos legales, expedientes médicos, información de medicamentos. Esos materiales o no son públicos, o están en PDF escaneados de mala calidad. Para que un modelo hable con la voz propia de un sector, alguien tiene que recopilar, limpiar y normalizar los datos. Es un trabajo tedioso que influye más en el resultado que la elección de la arquitectura. Hablaremos de ello por separado en otro artículo sobre datos de entrenamiento.
Los tonos no son un adorno
El vietnamita tiene seis tonos y la marca es parte del significado. 'Ma', 'má', 'mà', 'mả', 'mã' y 'mạ' son seis palabras distintas. Las personas entienden el vietnamita sin acentos gracias al contexto, pero un modelo no necesariamente. En la práctica, los usuarios escriben sin acentos con mucha frecuencia, sobre todo en el celular y en mensajes rápidos. También se equivocan con el método Telex, se les pasa una tecla y sale 'dduowcj' o 'đuơc'. Los mensajes de voz convertidos a texto igualmente pierden los tonos o ponen los equivocados.
Un modelo que solo aprendió con texto editado y limpio se desorienta ante esos datos. Uno que ha visto suficientes ejemplos reales, incluidos textos con errores, aprende a adivinar bien. Esto pesa especialmente en aplicaciones de voz: el reconocimiento de voz (speech to text) en vietnamita produce texto, y ese texto es justamente la entrada del LLM. Un error de tono en la capa de reconocimiento pasa directo a la capa de comprensión. Por eso tratamos el ASR y el LLM como dos mitades del mismo problema, no como dos productos separados.
Cómo habla realmente la gente en Vietnam
Esta es la parte más difícil de medir. Los vietnamitas se tratan según edad, jerarquía y relación: anh, chị, em, cô, chú, mình, tớ. Partículas como 'ạ', 'nhé', 'nha' y 'hen' cambian por completo el matiz de una frase. Si un empleado de banco escribe 'dạ anh chờ em chút ạ' y el modelo responde con un tono de libro de texto, 'Quý khách vui lòng đợi trong giây lát', no es un error, pero suena rígido. El vocabulario cambia entre el sur, el centro y el norte. La gente joven mezcla inglés en sus frases: 'deadline dí rồi', 'book lịch giúp em'. Y abundan las abreviaturas: 'k', 'ko', 'đc', 'dt', 'sđt'.
Un modelo multilingüe suele entender la mayoría de estas cosas, pero a veces «corrige» de más: normaliza lo que no había que normalizar o responde con un tono demasiado formal. En un chatbot de atención a clientes o en un asistente interno, el tono es parte del producto.
Cuándo todavía no hace falta entrenamiento propio
No quiero que este artículo suene a anuncio. Si solo necesitan resumir correos, redactar borradores o clasificar tickets con pocos datos, un modelo multilingüe con un buen prompt suele bastar. Si el problema es que al modelo le falta conocimiento actualizado, RAG es más razonable. El entrenamiento o el fine-tuning vale la pena cuando se presenta alguna de estas situaciones: el costo de tokens en vietnamita se vuelve una carga a gran escala, se necesita un tono y una terminología consistentes, los datos sensibles deben procesarse en infraestructura propia, o el campo exige precisión terminológica, como la salud y la farmacia. La comparación entre estas opciones la desarrollamos en un artículo aparte sobre fine-tuning de LLM.
El punto de vista de AIVISION
AIVISION es una empresa de IA en Vietnam que entrena LLM en un clúster de 24 GPU NVIDIA H200 y 8 GPU NVIDIA B300. En cuanto al hardware, la H200 tiene 141 GB de memoria HBM3e con un ancho de banda de alrededor de 4.8 TB/s, y la B300 cuenta con unos 288 GB de HBM3e. Más memoria significa poder trabajar con modelos y contextos más largos sin tener que fragmentarlos tanto. Hemos lanzado el modelo LLM L1.0 para vietnamita y el modelo de speech-to-text E1.0, y nos concentramos en que la IA en Vietnam entienda el vietnamita tal como la gente lo habla, no solo como se escribe en los libros.
También realizamos entrenamiento y fine-tuning de LLM para campos específicos como salud y farmacia. En esos campos, el modelo es solo una herramienta de apoyo para información y tareas administrativas. No diagnostica, no receta, no recomienda dosis, y la decisión final siempre le corresponde a la persona con formación médica.
Los mercados de habla hispana o de tagalo enfrentan problemas muy parecidos: tokenizers sesgados, datos escasos y dialectos muy marcados. Lo aprendido con el vietnamita puede entonces llevarse a mercados como México o Filipinas, siempre que se tome el trabajo de medir antes de confiar.