AIVISION Speech-to-Text E1.0: Transcripción en GPU

28/09/2026

AIVISION Speech-to-Text E1.0: Transcripción en GPU

AIVISION presenta Speech-to-Text E1.0 (código de compilación aivision-s2s-ev-E1.0.0), un modelo de reconocimiento de voz en español con 1.5 mil millones de parámetros. El modelo procesa frases donde se intercala inglés en medio y es lo suficientemente pequeño para ejecutarse en una sola GPU o directamente en el dispositivo.

Pruebe la herramienta e integre la API en s2s.aivgroups.com.

Cifras clave

MétricaValorNota
WER promedio11,84%En 4 conjuntos de prueba reservados. Menor es mejor.
Voz en español4,58%FLEURS-vi
Hablado mixto español + inglés15,68%ViMedCSS (médico), mantiene la terminología en inglés

Modelo de 1.5B parámetros, entrenado con más de 50,000 horas de audio en español, incluyendo lectura, radio y conversaciones naturales.

Precisión por conjunto de prueba

WER (Word Error Rate) comparado con la transcripción humana, en cuatro conjuntos de prueba en español. Menor es mejor.

Conjunto de pruebaTipo de datosWER%
FLEURS-viLectura en español4,58
VIVOSLectura en español6,83
ViMedCSS testMédico, hablado mixto español + inglés15,68
AIV meetingsReuniones reales, habla natural, lejos del micrófono20,29
Promedio11,84

El conjunto AIV meetings es el más difícil porque son conversaciones reales, con varias personas hablando a la vez y grabadas desde lejos. Este es el tipo de audio que las empresas encuentran con mayor frecuencia al transcribir reuniones.

Comparación con otros modelos de código abierto

Realizamos una prueba independiente en tres conjuntos de prueba públicos en español (FLEURS-vi, VIVOS, ViMedCSS), con 300 frases por conjunto, el 29/08/2026.

#ModeloParámetrosWER% Prom.
1aivision-s2s-ev-E1.0.01.5B11,84*
2Qwen3-ASR-1.7B1.7B12,15
3PhoWhisper-large1.5B14,95
4Voxtral-Small-24B24B16,09
5Voxtral-Mini-3B3B21,31
6SeamlessM4T-v22.3B23,10

PhoWhisper-large es el mejor en lectura pura en español (VIVOS 4,79) pero el más débil cuando el hablante intercala inglés.

* Nota sobre la comparación: las cifras de los otros modelos se midieron en el conjunto de tres pruebas públicas. La cifra de 11,84 de E1.0 se midió en un conjunto de cuatro conjuntos internos, más difícil por incluir audio de reuniones AIV. Por lo tanto, el ranking es solo referencial, no es una comparación estricta en el mismo conjunto de pruebas.

Por qué elegir E1.0

  • Español cercano a la transcripción. La lectura limpia alcanza un WER de 4,58 en FLEURS-vi y 6,83 en VIVOS, igualando a los mejores modelos abiertos aunque sea mucho más pequeño.
  • Inglés dentro de frases en español. Mantiene la terminología técnica en inglés en lugar de transcribirla incorrectamente: WER de 15,68 en el conjunto médico de habla mixta, donde los modelos que solo aprenden español suelen fallar más.
  • Lo suficientemente pequeño para autoalojamiento. 1.5B parámetros que se ejecutan en una GPU o en el dispositivo. Los datos de audio no salen de su sistema, no requiere servidores masivos y no incurre en costos de nube por minuto.

Método de evaluación

  • Audio fijo de 16 kHz, comparado con la transcripción humana.
  • Los números se leen en texto en ambos lados, el WER se calcula de la misma manera en todos los conjuntos de prueba.
  • La precisión en inglés se reporta actualmente como inglés intercalado en español. Aún no publicamos el WER para inglés puro.

Prueba

Visite s2s.aivgroups.com para probar el modelo y ver la documentación de la API. Si necesita asesoría para implementación local en su empresa, contacte al equipo de AIVISION.

Artículos relacionados

Ver todos los artículos