JEV-VERGLEICH · JEVBENCH V1.3.0 · AKTUALISIERT AM 22. SEPTEMBER 2026
Jev und SemIf im Vergleich
Der stärkste offene Nachbau im Vergleich – und seine verbleibenden Schwächen.
Auf dieser Website
Jev 1.13.0
TypeSafe · System-One-Modell
Kein eigener Betrieb nötig – und trotzdem vorn, wenn die Fälle schwierig werden.
Alternative
SemIf
TheoLeeCJ · offener Logit-Reader auf Qwen3.5-4B
Liegt auf einer bereits vorhandenen Grafikkarte nur 1,3 Punkte hinter Jev.
Der Benchmark
JevBench v1.3.0 – einheitlich gemessen
Ein Benchmark hat alle 52 Systeme nach derselben Methode getestet. Die Balken lassen sich daher direkt miteinander vergleichen – anders als herstellerseitig veröffentlichte Werte.
Gesamtpunktzahl
Höher ist besser
JevBench v1.3.0
Die ersten drei liegen höchstens 1,4 Punkte auseinander; danach fällt das Feld deutlich ab. Die Gesamtpunktzahl verdeckt die tatsächlichen Unterschiede, deshalb schlüsseln die folgenden Diagramme sie auf.
Genauigkeit nach Schwierigkeitsgrad
Hier gehen die Entscheidungen auseinander
Einfach
72 unkomplizierte Fälle
Standard
96 alltägliche Fälle
Bewertung
146 Aufrufe im Evaluierungsstil
SchwierigSchwierig
220 tatsächlich mehrdeutige Fälle
Bei einfachen und mittleren Entscheidungen gibt es kaum Unterschiede. Erst bei schwierigen Fällen weichen die Systeme deutlich voneinander ab.
Die fehlende vierte Kennzahl: Kosten
The composite also weighs cost, scored from each system's public list price. Jev places last on that axis, but the benchmark does not turn a single price into a recommendation: bursty traffic and idle GPU time change the economics of self-hosting.
Jev-Preise ansehenDie Rangliste
Alle Systeme im Vergleich
Oben sind die Leistungswerte dargestellt; hier folgen die zugehörige Rangliste und die Bereitstellungsdetails. Jev und SemIf sind hervorgehoben.
JevBench v1.3.0 bewertete am 21. September 2026 insgesamt 52 Systeme mit denselben 534 Entscheidungen (72 einfach, 96 Standard, 146 Bewertung, 220 schwierig), jeweils mit einer Anfrage.
Funktion für Funktion
Jev und SemIf im direkten Vergleich
Worin jedes Modell besser ist
Der praktische Kompromiss
In der Gesamtwertung liegt SemIf bemerkenswert nah an Jev. Entscheidend ist weniger die Rangliste als vielmehr, wer Infrastruktur, Daten und Kalibrierungsaufwand kontrolliert.
Worin Jev punktet
- Genauigkeit bei schwierigen Fällen: 74,1 % gegenüber 59,5 %.
- Die Kalibrierung ist ab Werk besser: 82,7 gegenüber 72,6.
- Keine GPU, Serving-Infrastruktur, Kapazitätsplanung oder Leerlaufkosten zu betreiben.
- 64.000 Tokens Kontext pro Anfrage und veröffentlichte Produktions-Ratenlimits.
Worin SemIf punktet
- Judge-tier accuracy: 95.2% against Jev's 94.5%.
- MIT-lizenzierter Code, den du lesen, forken, prüfen und mit kontrollierten Gewichten ausführen kannst.
- Keine Kosten pro Aufruf, sobald eine ausgelastete GPU ohnehin bezahlt ist.
- Offline-Betrieb möglich, einschließlich einer WebGPU-Browserdemo.
Die Analyse
Der Abstand zeigt sich gezielt, nicht überall
Give SemIf its due: 73.1 against Jev's 74.4 in JevBench v1.3.0, second on the board, and ahead on the 146-decision judge tier.
Der Abstand konzentriert sich auf zwei Bereiche. Bei 220 schwierigen Entscheidungen erreicht Jev 74,1 % und SemIf 59,5 %, ein Unterschied von 14,6 Punkten. Bei der Kalibrierung liegt Jev mit 82,7 gegenüber 72,6 vorn, weil seine Wahrscheinlichkeiten für die Entscheidungsschnittstelle trainiert werden, statt sie direkt aus einem eingefrorenen Modell auszulesen.
The third gap is operational. SemIf's low per-decision estimate assumes a rented GPU that stays busy. Idle GPUs bill the same as busy ones, so bursty traffic moves that number in a hurry.
Datengrenze
SemIf bleibt in deinem Netzwerk; Jev sendet Anfragen an eine gehostete API.
Betriebsmodell
Bei SemIf entfallen API-Gebühren, dafür übernimmst du GPU, Serving, Überwachung und Kalibrierung.
Entscheidungsformat
Beide eignen sich besonders, wenn Software eine typisierte Auswahl, Bewertung oder Ja-Nein-Entscheidung benötigt.
Offene Implementierung
Was SemIf tatsächlich ist
SemIf nimmt einen unstrukturierten Kontext, zur Anfragezeit definierte Kriterien und typisierte Optionen entgegen. Es führt einen Vorwärtsdurchlauf durch ein offenes Modell aus und liest die nativen Logits der Optionen aus, statt einen Antwortsatz zu generieren, JSON zu parsen und anschließend zu validieren.
Die primäre Benchmark-Konfiguration verwendet Qwen3.5-4B. Das Projekt unterstützt außerdem Qwen3-0.6B, MiniCPM5-2B und Qwen3-Reranker-4B. Der Code steht unter MIT; für Modellgewichte gelten weiterhin die jeweiligen Upstream-Lizenzen.
SemIf auf GitHub ansehenSelbst gehostet
Führe das Modell auf deiner GPU aus oder miete eine, wenn das Volumen es rechtfertigt.
Browserdemo
Teste eine WebGPU-Version direkt im Browser – ohne Warteliste.
Direkte Logits
Gibt typisierte Optionswahrscheinlichkeiten ohne autoregressive Ausgabeschleife zurück.
Datenschutz durch Architektur
Halte Kontext und Entscheidungskriterien in deinem Netzwerk.
SemIf hieß zuvor OpenJev. Es ist ein unabhängiges Projekt und steht weder mit TypeSafe oder Jev AI in Verbindung noch wird es von ihnen unterstützt.
Welches Modell solltest du wählen?
Wähle nach deinen Rahmenbedingungen
Jev passt, wenn
- Der Traffic schwankt stark oder du möchtest keine GPU-Serving-Infrastruktur betreiben.
- Die Eingaben umfassen lange, verrauschte oder umstrittene Fälle, bei denen die schwierige Stufe entscheidend ist.
- Du brauchst Schwellenwerte, die vom ersten Tag an funktionieren – ohne vorherige Kalibrierung.
SemIf passt, wenn
- Du besitzt ungenutzte GPU-Kapazität oder kannst eine gemietete GPU dauerhaft auslasten.
- Die Daten dürfen dein Netzwerk aus rechtlichen Gründen nicht verlassen.
- Die meisten Entscheidungen sind einfach, Standard- oder Bewertungsfälle und du kannst lokal kalibrieren.
Der faire Vergleich
Teste Jev mit den Fällen, über die ihr tatsächlich diskutiert.
Eine Rangliste gibt eine erste Orientierung. Aussagekräftiger sind deine eigenen schwierigen Fälle.
Häufige Fragen
FAQ: Jev und SemIf
Ist SemIf dasselbe wie OpenJev?+
SemIf ist der aktuelle Name des früher von TheoLeeCJ entwickelten Projekts OpenJev. Andere, nicht verwandte Projekte verwenden ebenfalls den Namen openJev.
Ist SemIf so genau wie Jev?+
In den meisten Stufen liegt SemIf nahe an Jev und in einer vorn. In JevBench v1.3.0 ist SemIf bei einfachen Entscheidungen gleichauf, bei Standardfällen knapp dahinter, gewinnt die Bewertungsstufe mit 95,2 % zu 94,5 % und liegt bei schwierigen Fällen mit 59,5 % zu 74,1 % zurück.
Welche Hardware benötige ich für SemIf?+
Die veröffentlichten Werte basieren auf einem 4B-Modell mit einer RTX 3090. Kleinere unterstützte Modelle laufen auch auf schwächerer Hardware. Es gibt zudem eine WebGPU-Browserdemo; für produktiven Durchsatz wird jedoch GPU-Kapazität vorausgesetzt.
Liefert SemIf kalibrierte Wahrscheinlichkeiten?+
SemIf liefert Wahrscheinlichkeiten abhängig von den vorgegebenen Optionen. Das Projekt bietet Temperaturkalibrierung; die README empfiehlt, die Wahrscheinlichkeiten für den jeweiligen Entscheidungs-Workload anzupassen und zu validieren.
Was kostet der Betrieb von SemIf?+
JevBench schätzt etwa 0,022 US-Dollar pro 1.000 Entscheidungen bei dauerhaft ausgelasteter GPU. Leerlaufzeiten und der technische Aufwand für den eigenen Betrieb sind nicht enthalten.
Die Zahlen stammen aus den obigen öffentlichen Quellen, geprüft am 22. September 2026. SemIf und alle weiteren auf dieser Seite genannten Produkte gehören ihren jeweiligen Eigentümern.