Evaluar un LLM en vietnamita: por qué no bastan los benchmarks
01/10/2026

Imaginen que contratan a alguien porque sacó una calificación altísima en el examen de selección y, el primer día de trabajo, no sabe cómo contestarle a un cliente. La calificación no estaba mal; solo medía algo distinto del trabajo. La puntuación de benchmark de un LLM suele ser exactamente así. En la evaluación de un LLM en vietnamita, esa brecha es todavía mayor, porque la mayoría de los conjuntos de medición públicos se diseñaron para inglés y luego se tradujeron, o se basan en exámenes de opción múltiple, muy lejos de cómo la gente usa realmente un modelo.
Lo que un benchmark mide y lo que no
Los benchmarks públicos tienen valor: ofrecen una base común para comparar y ayudan a detectar pronto modelos con problemas graves de conocimiento o razonamiento básico. Nosotros también los consultamos. Pero hay cuatro límites que conviene recordar.
Primero, el contenido: las preguntas de opción múltiple miden la capacidad de elegir una respuesta, no la de redactar un correo a un cliente con el tono adecuado. No miden cómo maneja el modelo mensajes sin acentos, abreviaturas o solicitudes ambiguas.
Segundo, la traducción: los conjuntos traducidos del inglés arrastran la construcción de frases y la cultura de origen. Una pregunta sobre leyes o trámites de otro país no dice nada sobre la comprensión del contexto vietnamita.
Tercero, la contaminación de datos: si las preguntas del benchmark ya se colaron en los datos de entrenamiento, una puntuación alta solo refleja memoria. Con conjuntos públicos de muchos años, el riesgo no es menor y casi imposible de verificar desde fuera.
Cuarto, el objetivo: cuando un número se vuelve lo que todos persiguen, la gente optimiza para ese número. Es un fenómeno conocido y los modelos no son la excepción. Por eso no presentamos puntuaciones de benchmark como evidencia principal de ningún producto de AIVISION, y desconfiamos de quien sí lo hace.
Un conjunto de evaluación propio: pequeño pero al grano
La forma más eficaz que conocemos es construir un conjunto de evaluación del problema concreto. No tiene que ser grande. Unos cientos de casos representativos, tomados de situaciones reales: preguntas que clientes de verdad hicieron (anonimizadas), documentos reales que hay que resumir, los casos difíciles en los que tropezó el sistema anterior. Cada caso con criterios de calificación claros: qué información debe aparecer, cuál no debe aparecer, qué tono se espera, cuándo debe negarse.
Conviene tener grupos de casos propios para los retos particulares del vietnamita: sin acentos, errores de Telex, abreviaturas, mezcla con inglés, tratamiento según jerarquía, dialectos. Y grupos para probar los límites: preguntas fuera de alcance, preguntas que intentan forzar al modelo a inventar, preguntas con premisas falsas. Un buen modelo no solo responde bien cuando sabe, también sabe decir «no estoy seguro» o «el documento no lo menciona» cuando no sabe. Esto se relaciona directamente con la reducción de alucinaciones, un tema al que le dedicamos otro artículo.
Quién califica y cómo
Hay tres maneras de calificar y cada una tiene fortalezas y debilidades.
- Calificación automática con reglas: rápida, repetible, adecuada cuando la respuesta es clara, como el formato JSON correcto, la cifra correcta o la presencia de cierto código. No alcanza para la calidad de un texto libre.
- Calificación por personas: la más confiable para matices, naturalidad y exactitud técnica, pero lenta, cara y los propios evaluadores discrepan entre sí. Requiere una escala clara y medir el grado de acuerdo entre calificadores.
- Usar otro modelo como juez: barato, rápido y escalable. Pero el juez tiene sus propios sesgos: prefiere respuestas largas, prefiere un estilo parecido al suyo y puede calificar mal el vietnamita especializado. Solo debe usarse después de contrastarlo con calificación manual sobre una muestra pequeña, para saber cuánto se desvía.
Una combinación práctica: automática para lo que una máquina puede verificar, modelo juez para filtrar grandes volúmenes, y personas para la muestra representativa y para todo caso importante. En campos como la salud o la farmacia, los expertos médicos deben participar directamente en la calificación, porque un pequeño error de terminología puede tener grandes consecuencias aunque el texto se lea con total fluidez.
Errores de medición frecuentes
Comparaciones injustas: un modelo con un prompt muy afinado frente a otro con el prompt por defecto. El resultado refleja a quien escribió el prompt, no al modelo.
Correr una vez y creerlo. La salida de un LLM tiene componentes aleatorios. Con un conjunto de evaluación pequeño, una diferencia de unos puntos puede ser puro ruido. Repitan las corridas, observen la variación y no celebren una mejora que cae dentro del margen de ruido.
Mirar solo el promedio. Un modelo puede ser excelente en el 95 por ciento de las preguntas y muy deficiente en el 5 por ciento restante. Si ese 5 por ciento son preguntas sobre dosis de medicamentos o normas legales, el promedio oculta lo más importante. Revisen por grupos y lean los casos fallidos por separado.
Olvidar medir lo que no es calidad: latencia, costo por consulta, estabilidad con contextos largos, comportamiento cuando el usuario intenta romperlo. Un modelo que gana unos puntos pero es el doble de lento puede ser la peor opción.
No medir después del despliegue. Los usuarios reales preguntan distinto que el conjunto de evaluación, y con el tiempo la diferencia crece. Conviene tomar muestras periódicas de conversaciones reales, recalificarlas y añadirlas al conjunto de evaluación.
Cómo ve esto AIVISION
Entrenamos LLM en un clúster de 24 GPU NVIDIA H200 y 8 GPU NVIDIA B300, y hemos lanzado el modelo LLM L1.0 para vietnamita y el speech-to-text E1.0. Aquí no damos cifras de ranking ni porcentajes de precisión genéricos, porque un número separado del problema concreto confunde más de lo que ayuda. Lo que vale la pena comparar es el resultado sobre su propio conjunto de preguntas, con sus propios datos.
Si están eligiendo entre modelos o evaluando un fine-tuning de LLM, mi consejo es dedicar la primera semana a armar el conjunto de evaluación, no a entrenar. Hace que todas las decisiones posteriores sean menos intuitivas y más fundamentadas. Pueden encontrar más información sobre nuestra forma de trabajar en AIVISION.