L1.0 de AIVISION: el LLM en vietnamita y lo que puede hacer

01/10/2026

L1.0 de AIVISION: el LLM en vietnamita y lo que puede hacer

Que un modelo de lenguaje responda con fluidez no significa que tenga la razón. Parece obvio, pero es la lección más cara que todos los que hacen productos de IA aprenden al menos una vez. Cuando en AIVISION publicamos L1.0, un LLM en vietnamita, quisimos presentarlo con ese mismo espíritu: decir con claridad qué es, en qué es útil y en qué todavía no conviene confiar.

Qué es L1.0

L1.0 es un modelo de lenguaje de gran tamaño para el idioma vietnamita, entrenado por AIVISION en un clúster de GPU compuesto por 24 GPU NVIDIA H200 y 8 GPU NVIDIA B300. La L del nombre corresponde a language, igual que la E de E1.0 remite al área de reconocimiento de voz, y el 1.0 recuerda que es la primera versión.

Aquí no encontrarán número de parámetros, tamaño de los datos de entrenamiento, puntajes de benchmark ni posiciones en rankings. No hemos publicado esa información y no queremos adivinar ni redondear para que se vea bien. La postura de AIVISION es que un modelo debe evaluarse con uso real en su trabajo real, más que con una cifra en un texto de presentación.

Qué puede hacer un LLM en vietnamita

Esta sección describe las capacidades típicas de un modelo de lenguaje de gran tamaño que procesa vietnamita, como una forma general de imaginar el tipo de tareas que se le pueden encomendar. Qué tan bien se haga cada tarea depende del modelo específico y de cómo lo usen, y conviene que lo prueben por su cuenta antes de confiar.

  • Redactar y ajustar textos: escribir borradores de correos, avisos y publicaciones, y luego ajustar el tono para que sea más formal o más cercano.
  • Resumir: reducir documentos largos, minutas de juntas o cadenas de mensajes a unas cuantas ideas principales.
  • Responder preguntas con base en documentos: el usuario pregunta, el sistema busca en el repositorio de documentos internos y reformula la respuesta en vietnamita.
  • Extraer información: obtener fechas, nombres, números de contrato y cláusulas principales de textos sin estructura.
  • Clasificar y etiquetar: clasificar comentarios de clientes, asignar solicitudes a categorías.
  • Transformar formatos: de texto hablado a texto escrito, de un párrafo a una tabla, de notas sueltas a un informe.

Combinada con un modelo de voz a texto (speech to text), esta cadena completa el ciclo: de la voz al texto y del texto a un resumen. Esa es la razón por la que los modelos E1.0 y L1.0 se desarrollan en paralelo.

Por qué hace falta un modelo propio para vietnamita

Los grandes modelos multilingües pueden manejar el vietnamita bastante bien, pero aun así vemos vacíos. Las formas de tratamiento son un ejemplo: anh, chị, em, ông, bà, cháu; cada elección lleva consigo una relación, una edad y un grado de cortesía. Si se usa mal el par de tratamiento, un texto gramaticalmente correcto sigue sonando como escrito por un extranjero. Lo mismo ocurre con los modismos, los eufemismos, el estilo administrativo característico y los usos de palabras que cambian según la región.

Nos enfocamos en estos detalles porque, para quien usa vietnamita, marcan la diferencia entre una herramienta que se puede usar y una que da gusto usar. Pero hay que ser sinceros: no nos atrevemos a decir que lo hayamos resuelto todo. Es un área con mucho por hacer, y cada versión posterior es un avance gradual, no un salto.

Fine-tuning por sector

Un modelo base es solo un punto de partida. El valor práctico suele venir del fine-tuning de LLM: continuar el entrenamiento con datos de un sector específico para que el modelo se familiarice con su terminología, su estilo y sus procesos. AIVISION lo hace para vietnamita y para sectores como salud y farmacia.

En salud y farmacia, el límite que ponemos es muy claro. El modelo es solo una herramienta de apoyo en información y administración, por ejemplo resumir documentos, redactar borradores u ordenar información para que la revise una persona con formación. No diagnostica, no receta, no recomienda dosis. El criterio médico de doctores y farmacéuticos siempre tiene la última palabra. La razón es directa: un LLM puede inventar algo que suena muy convincente, y en medicina lo convincente pero equivocado es lo más peligroso.

Límites que conviene conocer

Todo modelo de lenguaje de gran tamaño, incluido L1.0, tiene las limitaciones comunes de este tipo de tecnología.

  • Puede inventar información. Cuando no sabe, a veces responde con seguridad de todos modos. En documentos importantes, contrasten con la fuente.
  • Su conocimiento tiene una fecha de corte. El modelo solo sabe lo que estaba en los datos de entrenamiento, a menos que se conecte con fuentes de información actualizadas.
  • Depende de cómo se le pregunte. Con la misma solicitud, una redacción distinta puede dar resultados distintos.
  • No reemplaza la decisión de una persona en asuntos con consecuencias legales, financieras o médicas.

Consideramos que dejar claros estos límites es parte del producto. Quien sabe en qué confiar y qué debe verificar usa la herramienta con mucha más eficacia que quien recibió promesas exageradas.

Cómo probar un LLM para su trabajo

Un consejo práctico: no lo prueben con preguntas genéricas como «hábleme de Hanói». Tomen de cinco a diez situaciones reales de su trabajo, con la respuesta que ustedes consideran correcta, y vean cómo las resuelve el modelo. Pongan atención a las veces que se equivoca, porque el tipo de error importa más que la tasa de error: un error torpe es fácil de detectar, el error fluido es el que preocupa.

Si les interesa la IA en Vietnam y quieren seguir la evolución de L1.0, pueden visitar la página de inicio de AIVISION. Con este mismo enfoque, también nos interesan mercados como México y Filipinas, donde los usuarios igualmente necesitan modelos que entiendan el idioma y la cultura locales en lugar de limitarse a traducir del inglés.

Artículos relacionados

Ver todos los artículos