IA multilingüe: lecciones de un LLM en vietnamita para México
01/10/2026

Desarrollar un LLM para el vietnamita me enseñó muchas cosas que la documentación en inglés casi nunca menciona. Es un idioma con seis tonos, una escritura llena de diacríticos, usuarios que escriben sin acentos cuando van de prisa y regiones que usan palabras distintas para el mismo objeto. Cuando miro hacia mercados como México o Filipinas, me doy cuenta de que estos problemas no desaparecen. Cambian de forma. Este artículo habla de la IA multilingüe como problema y como enfoque general, no como anuncio de algún modelo en particular.
Conviene aclarar desde el principio: los modelos actuales de AIVISION, E1.0 y L1.0, se lanzaron para vietnamita. Lo que sigue es una reflexión sobre método, basada en nuestro trabajo con el vietnamita, y no una afirmación de que soportemos otro idioma.
Lo que nos enseñó el vietnamita
Hay tres grandes lecciones. Primero, los datos de alta calidad en un idioma con menos recursos son más escasos de lo que uno espera, sobre todo los datos especializados como textos médicos o farmacéuticos. Segundo, la normalización del texto exige más esfuerzo del que alguien planea: codificación de caracteres, diacríticos mal colocados, abreviaturas, jerga de redes sociales. Tercero, la evaluación. Los puntajes de benchmarks traducidos del inglés no dicen si un modelo entiende cómo habla la gente de verdad.
La voz agrega otra capa. Un sistema de voz a texto (speech to text) en vietnamita tiene que lidiar con acentos del norte, del centro y del sur, con el ruido de los centros de contacto y con personas que se interrumpen al hablar. Cada idioma nuevo trae un conjunto de problemas parecido, aunque distinto en los detalles.
El español en México: mismo idioma, mercado distinto
Mucha gente supone que el español tiene muchísimos recursos y que por eso el problema es fácil. Lo cierto es que los datos generales abundan. Lo que se subestima es que el español de México tiene vocabulario, formas de trato, modismos y un tono de atención a clientes que difieren de los de España o Argentina. Un chatbot de soporte con un registro rígido, a la europea, suena fuera de lugar de inmediato. A eso se suma la mezcla con inglés en los entornos de negocios, sobre todo cerca de la frontera.
Creo que las lecciones del vietnamita se aplican aquí: no traten el español como un solo bloque. Definan temprano la variante objetivo, reúnan datos de esa variante en particular y pidan a hablantes nativos de la región correcta que la revisen. Alguien de España quizá no note lo que a una persona en México le suena forzado.
Filipinas: muchos idiomas y alternancia de código
Filipinas es complicado de otra manera. Existe el filipino y muchas lenguas regionales, mientras que el inglés se usa ampliamente en el trabajo. Los usuarios suelen cambiar entre inglés y una lengua local dentro de una misma oración, lo que se conoce como alternancia de código (code-switching). Para el reconocimiento de voz esto es un dolor de cabeza: el modelo tiene que decidir a qué idioma pertenece cada palabra en pleno enunciado.
El vietnamita tiene su propia versión, cuando la gente de tecnología mezcla términos en inglés en el habla cotidiana, como preguntar si ya terminó el deploy. La experiencia indica que no se puede manejar tratando cada oración como monolingüe. Los datos de entrenamiento deben reflejar cómo habla la gente en realidad, aunque no sea lo “correcto” según el libro de texto.
Problemas técnicos que se repiten en todos los idiomas
- Tokenizadores. Los tokenizadores diseñados en torno al inglés suelen fragmentar el vietnamita, y muchos otros idiomas, en demasiados pedazos. El resultado son más tokens, inferencia más lenta y más cara, y a veces peor comprensión.
- Datos especializados. El vocabulario médico, jurídico y financiero de cada idioma hay que obtenerlo y verificarlo por separado. La traducción automática desde el inglés fácilmente produce términos que suenan bien pero que nadie usa.
- Dialectos y acentos. Juntar todo en un solo conjunto suele promediar el modelo y volverlo mediocre en todas partes.
- Seguridad y cultura. Lo que es delicado en un país puede ser normal en otro. Los filtros de seguridad traducidos palabra por palabra suelen fallar.
Cómo evaluar sin dejarse engañar por números bonitos
El error que más veo es medir un modelo multilingüe con conjuntos de prueba en inglés traducidos por máquina y concluir que entiende el idioma de destino. Esos conjuntos arrastran la estructura de las oraciones y el contexto cultural del inglés. Es más confiable un conjunto de prueba nativo: preguntas reales de usuarios reales, escritas por hablantes nativos, en el área correcta, con todo y errores de dedo y expresiones cotidianas.
Con el reconocimiento de voz pasa lo mismo: se necesitan grabaciones reales del entorno de uso, de los grupos de acento correctos y con el nivel de ruido adecuado. Un estudio limpio da resultados bonitos que no sobreviven al contacto con la realidad.
Cómo pensamos la expansión
AIVISION es una empresa de IA en Vietnam que entrena LLM en un clúster de 24x NVIDIA H200 y 8x NVIDIA B300, ha lanzado el modelo de reconocimiento de voz E1.0 y el LLM L1.0 para vietnamita, y realiza entrenamiento y fine-tuning para áreas como salud y farmacéutica. Operamos aivision.vn para Vietnam, aivgroups.com para lectores internacionales y aivision.mx para México, así que la localización es una pregunta real en nuestro trabajo.
El enfoque por el que nos inclinamos es avanzar mercado por mercado, con disciplina, en lugar de anunciar soporte para cien idiomas. En concreto: definir el área y la variante del idioma que se va a atender, trabajar con hablantes nativos para armar los datos y los conjuntos de prueba, medir en tareas reales y solo entonces expandir. Es más lento y, a cambio, se sabe qué puede y qué no puede hacer el modelo.
Lo que yo preguntaría si ustedes desarrollan IA para un mercado nuevo
- ¿Qué variante del idioma, en qué región y para qué grupo de usuarios?
- ¿De dónde salen legalmente los datos especializados y quién los verifica?
- ¿Qué hablantes nativos participan en la evaluación y representan a los usuarios reales?
- ¿Los usuarios alternan idiomas o abrevian, y sus datos ya reflejan eso?
- ¿Qué exigen las reglas de protección de datos de ese país sobre el lugar de almacenamiento?
Responder estas cinco preguntas antes de escribir la primera línea de código con frecuencia ahorra meses. Un idioma no son solo letras. Son hábitos y contexto, y un modelo solo es bueno cuando los datos lo colocan en el contexto correcto.