Preguntas frecuentes sobre voz a texto y LLM en vietnamita

01/10/2026

Preguntas frecuentes sobre voz a texto y LLM en vietnamita

Recibimos muchas preguntas repetidas de equipos que están considerando voz a texto (speech to text) en vietnamita y un LLM en vietnamita para trabajo real. En lugar de contestar por correo una por una, las reunimos aquí. Algunas las podemos responder de inmediato y en otras tenemos que decir claramente que hace falta conversar caso por caso. Preferimos ser honestos antes que dar una cifra bonita que no se ha medido en su problema.

Sobre AIVISION y los modelos

¿Quién es AIVISION?

AIVISION es una empresa de IA en Vietnam. Entrenamos LLM en un clúster de 24x NVIDIA H200 y 8x NVIDIA B300, y hacemos entrenamiento y fine-tuning de LLM para el vietnamita y para áreas específicas como salud y farmacéutica. Nuestros sitios web son aivision.vn para vietnamita, aivision.mx para México y aivgroups.com para inglés.

¿Qué son E1.0 y L1.0?

E1.0 es un modelo de speech to text, es decir, convierte la voz en texto, y L1.0 es un modelo de lenguaje grande (LLM), ambos para vietnamita. Ya lanzamos los dos. En pocas palabras: E1.0 escucha, L1.0 entiende y genera texto. Pueden trabajar juntos, por ejemplo escuchando una llamada para luego resumirla.

¿Cuántos parámetros tienen los modelos?

En este artículo no publicamos la cantidad de parámetros. Ese número tampoco dice mucho sobre si un modelo se ajusta a su problema, ya que un modelo pequeño con buen fine-tuning puede convenirles más que uno grande de propósito general. Si necesitan datos técnicos para evaluar la infraestructura, contáctennos y lo platicamos según sus necesidades específicas.

¿Qué porcentaje de precisión tienen?

Esta la dejamos sin responder con un solo número, a propósito. La precisión del reconocimiento de voz depende mucho de la calidad del audio, de los acentos regionales, del ruido, del vocabulario del área y de cómo se mide. Una cifra obtenida en un estudio de grabación no dice nada sobre su centro de contacto. Lo más confiable es probar con sus propias grabaciones reales y medir juntos. Contáctennos para organizarlo.

Sobre voz a texto en vietnamita

¿Qué hace difícil el voz a texto en vietnamita?

El vietnamita tiene seis tonos, y dos palabras que solo difieren en la marca de tono pueden significar cosas totalmente distintas. A eso se suman los acentos del norte, del centro y del sur, las palabras regionales, quienes hablan rápido y se comen sílabas, las conversaciones con varias personas y el ruido. En áreas como la medicina, los nombres de medicamentos y los términos poco comunes lo complican todavía más. Por eso nos concentramos en datos y evaluaciones muy cercanos a las condiciones reales de uso.

¿Qué condiciones de audio dan mejores resultados?

Algunas recomendaciones generales: colocar el micrófono cerca de quien habla, reducir el eco, evitar una compresión de audio excesiva y, de ser posible, separar un canal por cada persona que habla. Esto no depende de un modelo en particular. A veces cambiar de lugar el micrófono mejora los resultados más que cambiar de modelo.

¿Puede manejar términos especializados?

Esta es una de las razones por las que hacemos fine-tuning para áreas específicas como salud y farmacéutica. Los términos especializados son justo donde los modelos generales suelen fallar. Cuánta mejora se obtiene hay que medirlo con sus datos, y no damos cifras antes de contar con esa medición.

Sobre los LLM en vietnamita y el fine-tuning

¿En qué se diferencia el fine-tuning de un LLM de usar un modelo ya hecho?

Un modelo ya hecho funciona de inmediato, pero puede interpretar mal la terminología, responder en un formato equivocado o sonar desentonado. El fine-tuning sigue entrenando con sus datos para que el modelo se familiarice con su área y su forma de trabajar. A cambio, se necesitan buenos datos y una evaluación seria. No todos los problemas requieren fine-tuning. A veces basta con RAG o con un prompt bien escrito.

¿Debo usar RAG o fine-tuning?

Si el chatbot sobre todo consulta documentos que cambian seguido, empiecen con RAG. Si el problema es que el modelo interpreta mal los términos o entrega un formato equivocado, vale la pena considerar el fine-tuning. Muchos buenos sistemas usan ambos. Normalmente sugerimos medir primero los errores reales y después decidir.

¿Cuánto cuesta?

No damos un precio general porque el costo depende del volumen de datos, de cuánta limpieza se necesite, del tamaño del modelo, de la infraestructura y de los requisitos de operación. Contáctennos para platicar sobre sus necesidades y les explicaremos con claridad qué se cobra en cada concepto.

Sobre el despliegue y los datos

¿Se puede correr on-premise?

Para muchos clientes, en especial en salud y finanzas, saber si los datos salen de la organización es la primera pregunta. Estamos abiertos a conversar sobre las opciones de despliegue, incluso instalarlo dentro del entorno del propio cliente, según los requisitos y la capacidad de operación de ambas partes. La opción específica debe platicarse caso por caso.

¿Cómo se manejan mis datos?

El principio que seguimos es que los datos del cliente le pertenecen al cliente. Los detalles sobre almacenamiento, plazos de borrado, anonimización y usos permitidos deben quedar por escrito en el acuerdo, y recomendamos a todos los clientes leer con cuidado esta parte con cualquier proveedor, no solo con nosotros.

¿El sistema soporta otros idiomas además del vietnamita?

E1.0 y L1.0 se lanzaron para vietnamita. No afirmamos que soporten otros idiomas por el momento. Si necesitan otro idioma, avísennos y lo conversamos como un problema aparte.

¿Cómo empiezo una prueba?

Lo más práctico es comenzar con una tarea acotada y una pequeña cantidad de datos reales: unas cuantas decenas de grabaciones, o unas cuantas decenas de preguntas típicas. Acuerden juntos los criterios de éxito antes de correr nada. Así tendrán evidencia concreta en lugar de promesas. Hay más información en AIVISION.

¿Por qué las respuestas de aquí tienen tan pocas cifras?

Porque queremos ser honestos. La precisión, la latencia y el costo dependen de su problema, de sus datos y de su infraestructura. Una cifra genérica suena atractiva pero confunde con facilidad, y preferimos que ustedes midan directamente y juzguen por su cuenta. Si están comparando varios proveedores, usen el mismo conjunto de datos de prueba con todos, incluidos nosotros.

Artículos relacionados

Ver todos los artículos