¿Quién es AIVISION? El equipo de IA que entrena sus propios LLM
01/10/2026

Hay una pregunta que escuchamos una y otra vez cuando conocemos a gente de fuera del sector: ¿a qué se dedica realmente AIVISION? ¿Es una empresa de chatbots, un proveedor de API o apenas un nombre nuevo en la ola de la inteligencia artificial? La respuesta corta es esta: AIVISION es una empresa de IA en Vietnam que entrena sus propios modelos de lenguaje de gran tamaño (LLM) sobre infraestructura de GPU propia. Este artículo lo cuenta con más detalle, incluso en los puntos que todavía tenemos a medias.
A qué se dedica AIVISION, sin rodeos
El corazón del trabajo es entrenar y hacer fine-tuning de LLM para el idioma vietnamita. No se trata de tomar un modelo extranjero ya hecho y empaquetarlo de nuevo, sino de entrar al proceso de entrenamiento de verdad: preparar los datos, entrenar, evaluar, corregir y volver a entrenar. Suena sencillo, pero cualquiera que lo haya hecho sabe cuánto tiempo y dinero consume ese ciclo.
Hasta ahora AIVISION ha publicado dos modelos. El primero es E1.0, un modelo de voz a texto (speech to text) para vietnamita, es decir, convierte la voz en texto escrito. El segundo es L1.0, un LLM para vietnamita. Les pusimos un nombre modesto, 1.0, a propósito: son las primeras versiones y queda mucho por hacer en las siguientes.
Además de estos dos modelos base, realizamos entrenamiento y fine-tuning de LLM para sectores específicos, entre ellos salud y farmacia. Estas dos áreas merecen mención aparte, porque tienen restricciones muy distintas a las de un chatbot de atención a clientes. Volveremos a ellas más abajo.
Por qué tener infraestructura propia
Mucha gente pregunta por qué no rentar GPU en la nube por hora para no inmovilizar capital. La respuesta honesta es que rentar sigue siendo una opción razonable para muchos equipos, y no lo negamos. Pero cuando entrenar es trabajo de todos los días y no un experimento aislado, contar con un clúster propio cambia la forma de trabajar. Uno se atreve a probar una idea dudosa, a dejar la máquina corriendo toda la noche, a reentrenar una vez más porque los datos acaban de limpiarse.
El clúster de AIVISION consta de 24 GPU NVIDIA H200 y 8 GPU NVIDIA B300. Según las especificaciones públicas de NVIDIA, cada H200 tiene 141 GB de memoria HBM3e con un ancho de banda cercano a 4.8 TB/s, mientras que la B300, de la generación Blackwell Ultra, ofrece alrededor de 288 GB de HBM3e. Los dos grupos no se sustituyen, se complementan; lo detallamos en dos artículos aparte sobre AIVISION que publicaremos próximamente.
Una aclaración por honestidad: tener buenas GPU no genera automáticamente un buen modelo. La mayor parte de la calidad depende de los datos, de la forma de evaluar y de la paciencia del equipo. Las GPU solo aceleran el ciclo de prueba y error. Quien dice que el hardware lo es todo, probablemente vende hardware.
El vietnamita es un problema propio
Los modelos de lenguaje extranjeros suelen manejar el vietnamita de forma aceptable, pero no siempre natural. Quien los ha usado lo nota: oraciones correctas en gramática pero con un tono extraño, vocabulario de raíz sino-vietnamita donde no hace falta, o tropiezos con las formas de tratamiento. El vietnamita tiene un sistema de tonos, pronombres personales complejos y muchísimas variantes regionales. Un buen LLM en vietnamita tiene que entender todo eso.
Por eso nos enfocamos en el LLM en vietnamita y en el voz a texto en vietnamita como dos caras del mismo problema: la máquina debe poder escuchar a quien habla vietnamita, y también escribir y responder en vietnamita según el contexto. Aquí no damos ninguna cifra de precisión, porque un número sin su conjunto de datos y su método de medición no significa nada.
Salud y farmacia: trabajar con más cuidado
Cuando se trata de salud, todo se hace más despacio. Hacemos fine-tuning de LLM para salud y farmacia, pero el papel del modelo está definido de forma muy estrecha: apoyo en información y en tareas administrativas. Por ejemplo, resumir documentos, ordenar información o redactar borradores para que una persona con la formación adecuada los revise.
- El modelo no diagnostica enfermedades.
- El modelo no receta ni recomienda dosis de medicamentos.
- La decisión final siempre corresponde a médicos, farmacéuticos y personal con formación médica.
No es una advertencia puesta por trámite. Un modelo de lenguaje puede escribir una respuesta muy fluida y aun así equivocarse, y en medicina un error fluido es más peligroso que uno torpe. Diseñamos el producto para que la persona sea siempre el último filtro.
Tres sitios web, tres mercados
AIVISION opera tres sitios web: aivision.vn en vietnamita, aivgroups.com en inglés para lectores internacionales y aivision.mx para el mercado de México. Tener versiones propias no es un adorno. Cada mercado tiene idioma, costumbres y necesidades distintas, y queremos tener claro con quién hablamos. En mercados como Filipinas o México, donde las lenguas locales y los acentos son tan variados como en Vietnam, lo aprendido con el vietnamita es una experiencia valiosa, aunque no prometemos nada sobre una hoja de ruta.
Lo que todavía no hemos logrado
Hay cosas que conviene decir. No hemos publicado benchmarks comparativos, no hemos dado a conocer el número de parámetros de nuestros modelos y no vamos a afirmar que el nuestro es mejor que otro mientras no exista una medición pública lo bastante rigurosa. Si leen una página de presentación de IA en la que todo es el número uno, desconfíen.
Lo que sí podemos hacer es mostrarles el camino que seguimos: entrenar por cuenta propia, ser dueños de la infraestructura, publicar modelos reales y concentrarnos en los problemas del vietnamita que los modelos masivos suelen dejar de lado. Si ustedes son ingenieros, investigadores o gente de producto que quiere conocer la IA en Vietnam, los próximos artículos del blog profundizarán en cada área: el clúster H200, las B300, los modelos E1.0 y L1.0, y las dificultades del reconocimiento de voz en vietnamita.
Escribimos este blog para dejar constancia del proceso, tanto de lo que funciona como de lo que falla. Cada artículo tendrá algo concreto que ustedes puedan verificar o cuestionar, y lo recibiremos con gusto.