PERFIL DEL MODELO · ACTUALIZADO EL 22 DE SEPTIEMBRE DE 2026
Jev-Omni
Un clasificador de decisiones que entiende imágenes, sonido y vídeo, no solo texto.
Jev-Omni toma la idea de decisiones tipadas de Jev y la extiende más allá del texto. Proporciónale un contexto, una pregunta y una lista de opciones; devolverá una probabilidad para cada opción.
DECISIÓN MULTIMODAL
Jev-Omni
Pregunta
¿Hay que escalar este vídeo a una persona?
MODELO BASE
Gemma 4 12B IT
PARÁMETROS
12B
LICENCIA
Apache-2.0
AUTOR
akhilaaa3
QUÉ PUEDE LEER Y A QUÉ VELOCIDAD
Cuatro modalidades, una interfaz de decisión
Medianas publicadas de 20 solicitudes en una H200 preparada y con un backend optimizado. El preprocesamiento y la red añaden tiempo; una GPU más pequeña será más lenta.
Texto
Alrededor de 2.000 tokens en la medición publicada.
Imagen
Una imagen por solicitud.
Audio
Máximo de 30 segundos. Requiere ffmpeg.
Vídeo
Se procesa muestreando 16 fotogramas.
Toma estas cifras como referencia, no como garantía: se midieron en una H200 preparada y no incluyen el preprocesamiento multimedia ni la red.
QUÉ ES JEV-OMNI
Un clasificador, no un modelo de chat
Jev-Omni es un proyecto independiente de akhilaaa3, no un modelo de TypeSafe. Usa Gemma 4 12B IT de Google con una cabeza de clasificación, se ajustó con 30.000 preguntas de decisión y se publicó como modelo combinado.
La cabeza evalúa las opciones que proporcionas y devuelve una distribución de probabilidades. No genera explicaciones ni tokens de salida, así que tu aplicación se encarga de la interpretación y la acción finales.
La entrada multimodal proviene de Gemma 4. El cargador obtiene los componentes necesarios en el primer uso. Los pesos usan Apache-2.0; la ficha indica que los derechos del conjunto de entrenamiento no están cubiertos por esa licencia.
RESULTADOS PUBLICADOS
Cifras útiles, con su contexto
La ficha incluye tanto el promedio con el mismo peso por escenario o grupo como el promedio micro de todas las preguntas.
| Benchmark | Alcance | Precisión | Precisión micro |
|---|---|---|---|
| DecisionBench Medium | 80 escenarios / 293 preguntas | 87,57% | 86,01% |
| JevBench (subconjunto comparable) | 195 grupos / 231 decisiones | 86,15% | 87,45% |
| MMAU | 1.000 preguntas | — | 63,10% |
| MVBench | 14 tareas / 2.786 preguntas | 53,10% | 53,09% |
TAMAÑO Y COBERTURA
Qué compara la ficha del modelo
Estas cifras de referencia se han tomado de la ficha del modelo. Los autores advierten que los modelos más grandes publican sus propias cifras oficiales y pueden usar protocolos de evaluación distintos.
| Modelo | Parámetros | MMAU | MVBench | Modalidades |
|---|---|---|---|---|
| Jev-Omni | 12B | 63,10% | 53,10% | Texto, imagen, audio y vídeo |
| Inkling | 975B en total / 41B activos | 77,20% | — | Texto, imagen y audio |
| Qwen3.5-397B-A17B | 397B en total / 17B activos | — | 77,60% | Texto, imagen y vídeo |
Es una comparación de tamaño y cobertura, no una afirmación de calidad. Según la ficha, Jev-Omni no pretende igualar a los modelos de referencia más grandes.
EJECUCIÓN
Ejecuta el clasificador en tu propia GPU
Se requiere una GPU CUDA. Los pesos FP32 ocupan unos 50 GB antes de contar la memoria de ejecución; la inferencia usa autocast BF16. Reserva memoria adicional y verifica tu hardware antes de descargarlo.
Antes de empezar
Prepara una máquina CUDA con memoria suficiente para los pesos y la ejecución. Comprueba la precisión, la calibración y el procesamiento multimedia con tus datos antes de integrar el modelo en producción.
pip install -r https://huggingface.co/akhilaaa3/Jev-Omni/resolve/main/requirements.txtfrom huggingface_hub import snapshot_download
path = snapshot_download("akhilaaa3/Jev-Omni")
import sys
sys.path.insert(0, path)
from jev_omni import load_jev_omni
classifier = load_jev_omni()
result = classifier(state, question, options)Para imágenes, audio o vídeo, añade media="/path/to/file" y modality="image", "audio" o "video".
LÍMITES QUE CONVIENE CONOCER
Las concesiones forman parte del modelo
Jev-Omni es útil para decisiones multimodales bien delimitadas. Es menos adecuado si necesitas generación abierta, medios largos o una explicación de la opción elegida.
- En la práctica, unas 20 opciones. La cabeza acepta hasta 256, pero no se ha establecido la calidad por encima de 20.
- Solo admite medios breves. El audio tiene un máximo de 30 segundos y el vídeo se reduce a 16 fotogramas.
- Es un clasificador. No genera tokens de salida ni explica por qué eligió una opción.
- Requiere hardware potente: unos 50 GB de pesos y una GPU CUDA. Las velocidades publicadas se midieron en una H200.
- Los derechos del conjunto de datos son independientes de la licencia Apache-2.0 de los pesos. Consulta la ficha antes de redistribuirlos.
¿JEV-OMNI O JEV?
Elige según el contexto que necesitas entender
La diferencia es sencilla: Jev-Omni añade entrada multimedia y alojamiento propio; Jev se centra en decisiones rápidas de texto a través de una API alojada.
ELIGE JEV-OMNI SI
la decisión es multimodal
- La decisión depende de una imagen, un audio breve o unos segundos de vídeo.
- Tienes una GPU CUDA con capacidad para un modelo multimodal 12B y quieres controlar pesos abiertos.
- Puedes validar la precisión y la calibración con tus datos antes de confiar en las cifras publicadas.
ELIGE JEV SI
la decisión se basa en texto
- Tu contexto es texto, adecuado para la mayoría de tareas de clasificación, moderación, enrutamiento y puntuación.
- Quieres probabilidades calibradas mediante una API alojada, sin instalar nada ni mantener una GPU.
- Quieres empezar en el navegador ahora, no después de descargar 50 GB.
Puedes probar ahora mismo la parte de texto
Ejecuta un caso real en la zona de pruebas de Jev y consulta toda la distribución de probabilidades antes de escribir una integración.
PREGUNTAS
Preguntas frecuentes sobre Jev-Omni
¿Qué es Jev-Omni?+
Un clasificador multimodal de decisiones con pesos abiertos creado por akhilaaa3 y ajustado con Gemma 4 12B IT de Google a partir de 30.000 preguntas de decisión.
¿Jev-Omni es de TypeSafe o está relacionado con Jev?+
No. Es un proyecto independiente que adopta el nombre Jev y la idea de las decisiones tipadas. Jev de TypeSafe es otro producto: un modelo cerrado y alojado.
¿Jev-Omni aparece en la clasificación de JevBench?+
No como entrada directamente comparable. Su ficha informa de un 86,15% en un subconjunto comparable de tareas JevBench, mientras que la versión 1.3.0 usa otro protocolo y conjunto de clasificación.
¿Qué hardware necesita Jev-Omni?+
Una GPU CUDA. Los pesos FP32 ocupan unos 50 GB antes de contar la memoria de ejecución y la inferencia usa autocast BF16. Las velocidades publicadas se midieron en una H200.
¿Cuántas opciones puede manejar Jev-Omni?+
La cabeza admite hasta 256 opciones. La ficha indica que está mejor respaldada con 20 o menos y que la calidad por encima de esa cifra no se ha establecido.
¿Jev puede leer imágenes como Jev-Omni?+
No. Jev solo admite texto: cadenas, objetos JSON o arrays. Si tu decisión depende de una foto, una nota de voz o un vídeo, considera Jev-Omni como alternativa multimodal.
FUENTES
Consulta las fuentes primarias
Fuentes consultadas el 22 de septiembre de 2026.
Jev-Omni, Gemma y todos los productos citados pertenecen a sus respectivos propietarios. Las cifras se extraen de fuentes públicas y deben verificarse antes de tomar decisiones de producción.