MODELLPROFIL · AKTUALISIERT AM 22. SEPTEMBER 2026
Jev-Omni
Ein Entscheidungs-Klassifikator, der Bilder, Ton und Videos versteht – nicht nur Text.
Jev-Omni übernimmt Jevs Idee typisierter Entscheidungen und erweitert sie über Text hinaus. Übergib Kontext, eine Frage und eine Liste von Optionen; das Modell liefert für jede Option eine Wahrscheinlichkeit.
MULTIMODALE ENTSCHEIDUNG
Jev-Omni
Frage
Soll dieser Clip an einen Menschen eskaliert werden?
BASISMODELL
Gemma 4 12B IT
PARAMETER
12B
LIZENZ
Apache-2.0
AUTOR
akhilaaa3
WAS ES LIEST UND WIE SCHNELL
Vier Modalitäten, eine Entscheidungsschnittstelle
Veröffentlichte Medianwerte aus 20 Anfragen auf einem aufgewärmten H200 mit optimiertem Backend. Vorverarbeitung und Netzwerkzeit kommen hinzu; auf einer kleineren Karte dauert es länger.
Text
Etwa 2.000 Tokens in der veröffentlichten Messung.
Bild
Ein Bild pro Anfrage.
Audio
Auf 30 Sekunden begrenzt. ffmpeg muss installiert sein.
Video
Wird anhand von 16 Einzelbildern ausgewertet.
Betrachte diese Werte als Richtwert, nicht als Versprechen: Sie stammen von einem aufgewärmten H200 und schließen Medienvorverarbeitung sowie Netzwerkzeit aus.
WAS JEV-OMNI TATSÄCHLICH IST
Ein Klassifikator, kein Chatmodell
Jev-Omni ist ein unabhängiges Projekt von akhilaaa3 und kein TypeSafe-Modell. Es verwendet Googles Gemma 4 12B IT mit einem Klassifikationskopf, wurde anhand von 30.000 Entscheidungsfragen feinabgestimmt und als zusammengeführtes Modell veröffentlicht.
Der Klassifikationskopf bewertet die von dir angegebenen Optionen und gibt eine Wahrscheinlichkeitsverteilung zurück. Er erzeugt weder Erklärungen noch Ausgabetokens; die endgültige Interpretation und Aktion liegt bei deiner Anwendung.
Die multimodalen Eingaben stammen direkt von Gemma 4. Der Loader lädt die erforderlichen Komponenten bei der ersten Verwendung. Die Gewichte stehen unter Apache-2.0; laut Model Card sind die Rechte am Trainingsdatensatz davon nicht abgedeckt.
VERÖFFENTLICHTE ERGEBNISSE
Nützliche Zahlen mit dem nötigen Kontext
Die Model Card nennt sowohl einen gleich gewichteten Durchschnitt über Szenarien oder Gruppen als auch einen Mikro-Durchschnitt über alle Fragen.
| Benchmark | Umfang | Genauigkeit | Mikro-Genauigkeit |
|---|---|---|---|
| DecisionBench Medium | 80 Szenarien / 293 Fragen | 87,57% | 86,01% |
| JevBench (abgeglichene Teilmenge) | 195 Gruppen / 231 Entscheidungen | 86,15% | 87,45% |
| MMAU | 1.000 Fragen | — | 63,10% |
| MVBench | 14 Aufgaben / 2.786 Fragen | 53,10% | 53,09% |
GRÖSSE UND ABDECKUNG
Vergleich laut Model Card
Diese Referenzwerte wurden aus der Model Card übernommen. Die Autoren weisen darauf hin, dass die größeren Modelle eigene offizielle Werte melden und möglicherweise andere Evaluierungsverfahren verwenden.
| Modell | Parameter | MMAU | MVBench | Modalitäten |
|---|---|---|---|---|
| Jev-Omni | 12B | 63,10% | 53,10% | Text, Bild, Audio, Video |
| Inkling | 975B gesamt / 41B aktiv | 77,20% | — | Text, Bild, Audio |
| Qwen3.5-397B-A17B | 397B gesamt / 17B aktiv | — | 77,60% | Text, Bild, Video |
Dies ist ein Vergleich von Größe und Abdeckung, keine Aussage über die Qualität. Jev-Omni liegt hinter den größeren Referenzmodellen, wurde aber laut Model Card nicht gezielt darauf ausgelegt, mit ihnen gleichzuziehen.
AUSFÜHRUNG
Den Klassifikator auf deiner eigenen GPU ausführen
Eine CUDA-GPU ist erforderlich. Die FP32-Gewichte benötigen vor Laufzeit-Overhead etwa 50 GB; die Inferenz verwendet BF16-Autocast. Plane zusätzlichen Speicher ein und prüfe die Hardware vor dem Herunterladen.
Vor dem Start
Plane eine CUDA-Maschine mit ausreichend Speicher für Gewichte und Laufzeit ein. Prüfe Genauigkeit, Kalibrierung und Medienverarbeitung mit deinen eigenen Daten, bevor du das Modell in einen Produktiv-Workflow aufnimmst.
pip install -r https://huggingface.co/akhilaaa3/Jev-Omni/resolve/main/requirements.txtfrom huggingface_hub import snapshot_download
path = snapshot_download("akhilaaa3/Jev-Omni")
import sys
sys.path.insert(0, path)
from jev_omni import load_jev_omni
classifier = load_jev_omni()
result = classifier(state, question, options)Für Bild, Audio oder Video ergänze media="/path/to/file" und modality="image", "audio" oder "video".
DIESE GRENZEN SOLLTEST DU KENNEN
Die Kompromisse gehören zum Modell
Jev-Omni eignet sich für klar eingegrenzte multimodale Entscheidungen. Weniger geeignet ist es, wenn du offene Textgenerierung, lange Medien oder eine Erklärung der Auswahl benötigst.
- Praktisch etwa 20 Optionen. Der Klassifikationskopf akzeptiert bis zu 256, doch die Qualität oberhalb von 20 ist nicht belegt.
- Nur kurze Medien. Audio ist auf 30 Sekunden begrenzt, Video wird auf 16 Einzelbilder reduziert.
- Es ist ein Klassifikator. Es werden keine Ausgabetokens generiert und es gibt keine integrierte Erklärung für die gewählte Option.
- Hohe Hardwareanforderungen. Rechne mit etwa 50 GB für die Gewichte und einer CUDA-GPU; die veröffentlichten Geschwindigkeiten wurden auf einem H200 gemessen.
- Die Rechte am Datensatz sind von der Apache-2.0-Lizenz der Gewichte getrennt. Prüfe vor einer Weiterverbreitung die Model Card.
JEV-OMNI ODER JEV?
Wähle danach, welchen Kontext du verstehen musst
Die Abgrenzung ist einfach: Jev-Omni ergänzt Medieneingaben und Selbsthosting; Jev konzentriert sich auf schnelle, gehostete Textentscheidungen.
JEV-OMNI PASST, WENN
die Entscheidung multimodal ist
- Bei der Entscheidung geht es um ein Bild, einen kurzen Sprachclip oder einige Sekunden Video.
- Du hast eine CUDA-GPU mit Platz für ein multimodales 12B-Modell und möchtest offene Gewichte selbst kontrollieren.
- Du bist bereit, Genauigkeit und Kalibrierung mit eigenen Daten zu prüfen, bevor du den veröffentlichten Werten vertraust.
JEV PASST, WENN
die Entscheidung textbasiert ist
- Dein Kontext besteht aus Text – passend für die meisten Aufgaben in Triage, Moderation, Routing und Bewertung.
- Du möchtest kalibrierte Wahrscheinlichkeiten über eine gehostete API, ohne Installation und ohne eigene GPU.
- Du willst in der nächsten Minute im Browser starten, statt zuerst 50 GB herunterzuladen.
Den Textteil kannst du sofort testen
Führe einen realen Fall in der Jev-Spielwiese aus und prüfe die vollständige Wahrscheinlichkeitsverteilung, bevor du eine Integration schreibst.
FRAGEN
Jev-Omni – häufige Fragen
Was ist Jev-Omni?+
Ein multimodaler Entscheidungs-Klassifikator mit offenen Gewichten von akhilaaa3, feinabgestimmt auf 30.000 Entscheidungsfragen mit Googles Gemma 4 12B IT.
Wird Jev-Omni von TypeSafe entwickelt oder hängt es mit Jev zusammen?+
Nein. Es ist ein unabhängiges Projekt, das den Namen Jev und die Idee typisierter Entscheidungen aufgreift. TypeSafes Jev ist ein proprietäres, gehostetes Modell und ein anderes Produkt.
Ist Jev-Omni in der JevBench-Rangliste aufgeführt?+
Nicht als direkt vergleichbarer Ranglisteneintrag. Die Model Card nennt 86,15 % auf einer abgeglichenen JevBench-Teilmenge; JevBench v1.3.0 verwendet ein anderes Protokoll und eine andere Ranglistenbasis.
Welche Hardware benötigt Jev-Omni?+
Eine CUDA-GPU. Die FP32-Gewichte benötigen vor Laufzeit-Overhead etwa 50 GB; die Inferenz läuft mit BF16-Autocast. Die veröffentlichten Geschwindigkeiten wurden auf einem H200 gemessen.
Wie viele Optionen kann Jev-Omni verarbeiten?+
Der Klassifikationskopf akzeptiert bis zu 256 Optionen. Laut Model Card ist die Unterstützung bei höchstens 20 am besten; für mehr Optionen ist die Qualität nicht belegt.
Kann Jev wie Jev-Omni Bilder lesen?+
Nein. Jev verarbeitet ausschließlich Text: eine Zeichenfolge, ein JSON-Objekt oder ein Array. Wenn deine Entscheidung von einem Foto, einer Sprachnachricht oder einem Video abhängt, ist Jev-Omni die multimodale Alternative.
QUELLEN
Primärquellen lesen
Quellen geprüft am 22. September 2026.
Jev-Omni, Gemma und alle weiteren auf dieser Seite genannten Produkte gehören ihren jeweiligen Eigentümern. Angaben stammen aus den öffentlichen Quellen und sollten vor einer Produktionsentscheidung geprüft werden.