Jev AI

MODELLPROFIL · AKTUALISIERT AM 22. SEPTEMBER 2026

Jev-Omni

Ein Entscheidungs-Klassifikator, der Bilder, Ton und Videos versteht – nicht nur Text.

Jev-Omni übernimmt Jevs Idee typisierter Entscheidungen und erweitert sie über Text hinaus. Übergib Kontext, eine Frage und eine Liste von Optionen; das Modell liefert für jede Option eine Wahrscheinlichkeit.

MULTIMODALE ENTSCHEIDUNG

Jev-Omni

Frage

Soll dieser Clip an einen Menschen eskaliert werden?

Eskalieren0.91
Automatisch fortfahren0.09

BASISMODELL

Gemma 4 12B IT

PARAMETER

12B

LIZENZ

Apache-2.0

AUTOR

akhilaaa3

WAS ES LIEST UND WIE SCHNELL

Vier Modalitäten, eine Entscheidungsschnittstelle

Veröffentlichte Medianwerte aus 20 Anfragen auf einem aufgewärmten H200 mit optimiertem Backend. Vorverarbeitung und Netzwerkzeit kommen hinzu; auf einer kleineren Karte dauert es länger.

83 ms

Text

Etwa 2.000 Tokens in der veröffentlichten Messung.

26 ms

Bild

Ein Bild pro Anfrage.

31 ms

Audio

Auf 30 Sekunden begrenzt. ffmpeg muss installiert sein.

504 ms

Video

Wird anhand von 16 Einzelbildern ausgewertet.

Betrachte diese Werte als Richtwert, nicht als Versprechen: Sie stammen von einem aufgewärmten H200 und schließen Medienvorverarbeitung sowie Netzwerkzeit aus.

WAS JEV-OMNI TATSÄCHLICH IST

Ein Klassifikator, kein Chatmodell

Jev-Omni ist ein unabhängiges Projekt von akhilaaa3 und kein TypeSafe-Modell. Es verwendet Googles Gemma 4 12B IT mit einem Klassifikationskopf, wurde anhand von 30.000 Entscheidungsfragen feinabgestimmt und als zusammengeführtes Modell veröffentlicht.

Der Klassifikationskopf bewertet die von dir angegebenen Optionen und gibt eine Wahrscheinlichkeitsverteilung zurück. Er erzeugt weder Erklärungen noch Ausgabetokens; die endgültige Interpretation und Aktion liegt bei deiner Anwendung.

Die multimodalen Eingaben stammen direkt von Gemma 4. Der Loader lädt die erforderlichen Komponenten bei der ersten Verwendung. Die Gewichte stehen unter Apache-2.0; laut Model Card sind die Rechte am Trainingsdatensatz davon nicht abgedeckt.

VERÖFFENTLICHTE ERGEBNISSE

Nützliche Zahlen mit dem nötigen Kontext

Die Model Card nennt sowohl einen gleich gewichteten Durchschnitt über Szenarien oder Gruppen als auch einen Mikro-Durchschnitt über alle Fragen.

BenchmarkUmfangGenauigkeitMikro-Genauigkeit
DecisionBench Medium80 Szenarien / 293 Fragen87,57%86,01%
JevBench (abgeglichene Teilmenge)195 Gruppen / 231 Entscheidungen86,15%87,45%
MMAU1.000 Fragen63,10%
MVBench14 Aufgaben / 2.786 Fragen53,10%53,09%
Interpretiere die JevBench-Zeile nicht als Ranglistenplatz. Sie zeigt 86,15 % auf einer abgeglichenen Teilmenge; JevBench v1.3.0 verwendet eine andere Mess- und Ranglistenbasis.

GRÖSSE UND ABDECKUNG

Vergleich laut Model Card

Diese Referenzwerte wurden aus der Model Card übernommen. Die Autoren weisen darauf hin, dass die größeren Modelle eigene offizielle Werte melden und möglicherweise andere Evaluierungsverfahren verwenden.

ModellParameterMMAUMVBenchModalitäten
Jev-Omni12B63,10%53,10%Text, Bild, Audio, Video
Inkling975B gesamt / 41B aktiv77,20%Text, Bild, Audio
Qwen3.5-397B-A17B397B gesamt / 17B aktiv77,60%Text, Bild, Video

Dies ist ein Vergleich von Größe und Abdeckung, keine Aussage über die Qualität. Jev-Omni liegt hinter den größeren Referenzmodellen, wurde aber laut Model Card nicht gezielt darauf ausgelegt, mit ihnen gleichzuziehen.

AUSFÜHRUNG

Den Klassifikator auf deiner eigenen GPU ausführen

Eine CUDA-GPU ist erforderlich. Die FP32-Gewichte benötigen vor Laufzeit-Overhead etwa 50 GB; die Inferenz verwendet BF16-Autocast. Plane zusätzlichen Speicher ein und prüfe die Hardware vor dem Herunterladen.

Vor dem Start

Plane eine CUDA-Maschine mit ausreichend Speicher für Gewichte und Laufzeit ein. Prüfe Genauigkeit, Kalibrierung und Medienverarbeitung mit deinen eigenen Daten, bevor du das Modell in einen Produktiv-Workflow aufnimmst.

pip install -r https://huggingface.co/akhilaaa3/Jev-Omni/resolve/main/requirements.txt
from huggingface_hub import snapshot_download
path = snapshot_download("akhilaaa3/Jev-Omni")
import sys
sys.path.insert(0, path)
from jev_omni import load_jev_omni
classifier = load_jev_omni()
result = classifier(state, question, options)

Für Bild, Audio oder Video ergänze media="/path/to/file" und modality="image", "audio" oder "video".

DIESE GRENZEN SOLLTEST DU KENNEN

Die Kompromisse gehören zum Modell

Jev-Omni eignet sich für klar eingegrenzte multimodale Entscheidungen. Weniger geeignet ist es, wenn du offene Textgenerierung, lange Medien oder eine Erklärung der Auswahl benötigst.

  • Praktisch etwa 20 Optionen. Der Klassifikationskopf akzeptiert bis zu 256, doch die Qualität oberhalb von 20 ist nicht belegt.
  • Nur kurze Medien. Audio ist auf 30 Sekunden begrenzt, Video wird auf 16 Einzelbilder reduziert.
  • Es ist ein Klassifikator. Es werden keine Ausgabetokens generiert und es gibt keine integrierte Erklärung für die gewählte Option.
  • Hohe Hardwareanforderungen. Rechne mit etwa 50 GB für die Gewichte und einer CUDA-GPU; die veröffentlichten Geschwindigkeiten wurden auf einem H200 gemessen.
  • Die Rechte am Datensatz sind von der Apache-2.0-Lizenz der Gewichte getrennt. Prüfe vor einer Weiterverbreitung die Model Card.

JEV-OMNI ODER JEV?

Wähle danach, welchen Kontext du verstehen musst

Die Abgrenzung ist einfach: Jev-Omni ergänzt Medieneingaben und Selbsthosting; Jev konzentriert sich auf schnelle, gehostete Textentscheidungen.

JEV-OMNI PASST, WENN

die Entscheidung multimodal ist

  • Bei der Entscheidung geht es um ein Bild, einen kurzen Sprachclip oder einige Sekunden Video.
  • Du hast eine CUDA-GPU mit Platz für ein multimodales 12B-Modell und möchtest offene Gewichte selbst kontrollieren.
  • Du bist bereit, Genauigkeit und Kalibrierung mit eigenen Daten zu prüfen, bevor du den veröffentlichten Werten vertraust.

JEV PASST, WENN

die Entscheidung textbasiert ist

  • Dein Kontext besteht aus Text – passend für die meisten Aufgaben in Triage, Moderation, Routing und Bewertung.
  • Du möchtest kalibrierte Wahrscheinlichkeiten über eine gehostete API, ohne Installation und ohne eigene GPU.
  • Du willst in der nächsten Minute im Browser starten, statt zuerst 50 GB herunterzuladen.

Den Textteil kannst du sofort testen

Führe einen realen Fall in der Jev-Spielwiese aus und prüfe die vollständige Wahrscheinlichkeitsverteilung, bevor du eine Integration schreibst.

Spielwiese öffnen

FRAGEN

Jev-Omni – häufige Fragen

Was ist Jev-Omni?+

Ein multimodaler Entscheidungs-Klassifikator mit offenen Gewichten von akhilaaa3, feinabgestimmt auf 30.000 Entscheidungsfragen mit Googles Gemma 4 12B IT.

Wird Jev-Omni von TypeSafe entwickelt oder hängt es mit Jev zusammen?+

Nein. Es ist ein unabhängiges Projekt, das den Namen Jev und die Idee typisierter Entscheidungen aufgreift. TypeSafes Jev ist ein proprietäres, gehostetes Modell und ein anderes Produkt.

Ist Jev-Omni in der JevBench-Rangliste aufgeführt?+

Nicht als direkt vergleichbarer Ranglisteneintrag. Die Model Card nennt 86,15 % auf einer abgeglichenen JevBench-Teilmenge; JevBench v1.3.0 verwendet ein anderes Protokoll und eine andere Ranglistenbasis.

Welche Hardware benötigt Jev-Omni?+

Eine CUDA-GPU. Die FP32-Gewichte benötigen vor Laufzeit-Overhead etwa 50 GB; die Inferenz läuft mit BF16-Autocast. Die veröffentlichten Geschwindigkeiten wurden auf einem H200 gemessen.

Wie viele Optionen kann Jev-Omni verarbeiten?+

Der Klassifikationskopf akzeptiert bis zu 256 Optionen. Laut Model Card ist die Unterstützung bei höchstens 20 am besten; für mehr Optionen ist die Qualität nicht belegt.

Kann Jev wie Jev-Omni Bilder lesen?+

Nein. Jev verarbeitet ausschließlich Text: eine Zeichenfolge, ein JSON-Objekt oder ein Array. Wenn deine Entscheidung von einem Foto, einer Sprachnachricht oder einem Video abhängt, ist Jev-Omni die multimodale Alternative.

QUELLEN

Primärquellen lesen

Quellen geprüft am 22. September 2026.

Jev AI auf GitHub

Jev-Omni, Gemma und alle weiteren auf dieser Seite genannten Produkte gehören ihren jeweiligen Eigentümern. Angaben stammen aus den öffentlichen Quellen und sollten vor einer Produktionsentscheidung geprüft werden.