Jev AI

JEV-VERGLEICH · JEVBENCH V1.3.0 · AKTUALISIERT AM 22. SEPTEMBER 2026

Jev und SemIf im Vergleich

Der stärkste offene Nachbau im Vergleich – und seine verbleibenden Schwächen.

Auf dieser Website

Jev 1.13.0

TypeSafe · System-One-Modell

74.4

Kein eigener Betrieb nötig – und trotzdem vorn, wenn die Fälle schwierig werden.

JevBench v1.3.0 · Platz 1
vs.

Alternative

SemIf

TheoLeeCJ · offener Logit-Reader auf Qwen3.5-4B

73.1

Liegt auf einer bereits vorhandenen Grafikkarte nur 1,3 Punkte hinter Jev.

JevBench v1.3.0 · Platz 2
Gehostete API – kein eigener Betrieb nötig
AUSFÜHRUNGSORT
Selbst gehostet auf einer eigenen oder gemieteten GPU
Proprietär und gehostet
LIZENZ
MIT-lizenzierter Code mit offenen Gewichten
94,5 % korrekt
EVALUATIONSFÄLLE
95,2 % korrekt
74,1 % korrekt
SCHWIERIGSTE TESTFÄLLE
59,5 % korrekt
Ab Werk kalibriert – 82,7 / 100
WAHRSCHEINLICHKEITEN
Muss an die eigene Arbeitslast angepasst werden – 72,6 / 100
Sent to TypeSafe's API
WOHIN DEINE DATEN GELANGEN
Verlässt niemals dein Netzwerk

Der Benchmark

JevBench v1.3.0 – einheitlich gemessen

Ein Benchmark hat alle 52 Systeme nach derselben Methode getestet. Die Balken lassen sich daher direkt miteinander vergleichen – anders als herstellerseitig veröffentlichte Werte.

Gesamtpunktzahl

Höher ist besser

JevBench v1.3.0

#1 Jev
74.4
#2 SemIf
73.1
#3 djev
73.0
#11 OpenJev
66.4
#33 Laya
54.4

Die ersten drei liegen höchstens 1,4 Punkte auseinander; danach fällt das Feld deutlich ab. Die Gesamtpunktzahl verdeckt die tatsächlichen Unterschiede, deshalb schlüsseln die folgenden Diagramme sie auf.

Genauigkeit nach Schwierigkeitsgrad

Hier gehen die Entscheidungen auseinander

Einfach

72 unkomplizierte Fälle

Jev 100%SemIf 100%

Standard

96 alltägliche Fälle

Jev 99%SemIf 97.9%

Bewertung

146 Aufrufe im Evaluierungsstil

Jev 94.5%SemIf 95.2%

SchwierigSchwierig

220 tatsächlich mehrdeutige Fälle

Jev 74.1%SemIf 59.5%

Bei einfachen und mittleren Entscheidungen gibt es kaum Unterschiede. Erst bei schwierigen Fällen weichen die Systeme deutlich voneinander ab.

Die fehlende vierte Kennzahl: Kosten

The composite also weighs cost, scored from each system's public list price. Jev places last on that axis, but the benchmark does not turn a single price into a recommendation: bursty traffic and idle GPU time change the economics of self-hosting.

Jev-Preise ansehen

Die Rangliste

Alle Systeme im Vergleich

Oben sind die Leistungswerte dargestellt; hier folgen die zugehörige Rangliste und die Bereitstellungsdetails. Jev und SemIf sind hervorgehoben.

ModellRangPunktzahlGemessene LatenzAusgeführt auf
Jev 1.13.0 (TypeSafe)#174.40,65 s Median / 0,72 s p95Gehostete Produktions-API
SemIf (Qwen3.5-4B)#273.10,20 s roh / 0,55 s angepasstSelbst gehostet, RunPod-GPU
djev (Maisa, DiffusionGemma)#373.00,24 s Median / 0,31 s p95Gehostete API, kostenlose Vorschau
OpenJev (razorback16)#1166.40,24 s roh / 0,63 s angepasstSelbst gehostet, RunPod-GPU
Laya (ModernBERT-large)#3354.40,79 s roh / 1,72 s angepasstSelbst gehostet, CPU

JevBench v1.3.0 bewertete am 21. September 2026 insgesamt 52 Systeme mit denselben 534 Entscheidungen (72 einfach, 96 Standard, 146 Bewertung, 220 schwierig), jeweils mit einer Anfrage.

Funktion für Funktion

Jev und SemIf im direkten Vergleich

MerkmalJev 1.13.0SemIf
Was es istGehostetes System-One-Modell von TypeSafe, Version jev-1.13.0Selbst gehosteter Logit-Reader für eingefrorene offene Modelle
LizenzProprietär und gehostetMIT-Lizenz für den Projektcode; für Modellgewichte gelten die Upstream-Lizenzen
BasismodellNicht veröffentlicht; mit RLCD weitertrainiertPrimär Qwen3.5-4B; außerdem Qwen3-0.6B, MiniCPM5-2B und Qwen3-Reranker-4B
HardwareKeine – es ist ein API-AufrufEigene GPU; die veröffentlichten Werte wurden auf einer RTX 3090 gemessen
KalibrierungFür kalibrierte Wahrscheinlichkeiten weitertrainiert; JevBench 82,7Abhängig von den vorgegebenen Optionen; Kalibrierung je Workload nötig. JevBench 72,6
Genauigkeit in der Bewertungsstufe94.5%95,2 % – SemIf liegt hier vorn
Genauigkeit bei schwierigen Fällen74.1%59.5%
BetriebskostenAbrechnung nach Jev-AI-Guthaben, ohne LeerlaufkostenEtwa 0,022 US-Dollar pro 1.000 Entscheidungen bei ausgelasteter Miet-GPU; Leerlauf wird weiterhin berechnet

Worin jedes Modell besser ist

Der praktische Kompromiss

In der Gesamtwertung liegt SemIf bemerkenswert nah an Jev. Entscheidend ist weniger die Rangliste als vielmehr, wer Infrastruktur, Daten und Kalibrierungsaufwand kontrolliert.

Worin Jev punktet

  • Genauigkeit bei schwierigen Fällen: 74,1 % gegenüber 59,5 %.
  • Die Kalibrierung ist ab Werk besser: 82,7 gegenüber 72,6.
  • Keine GPU, Serving-Infrastruktur, Kapazitätsplanung oder Leerlaufkosten zu betreiben.
  • 64.000 Tokens Kontext pro Anfrage und veröffentlichte Produktions-Ratenlimits.

Worin SemIf punktet

  • Judge-tier accuracy: 95.2% against Jev's 94.5%.
  • MIT-lizenzierter Code, den du lesen, forken, prüfen und mit kontrollierten Gewichten ausführen kannst.
  • Keine Kosten pro Aufruf, sobald eine ausgelastete GPU ohnehin bezahlt ist.
  • Offline-Betrieb möglich, einschließlich einer WebGPU-Browserdemo.

Die Analyse

Der Abstand zeigt sich gezielt, nicht überall

Give SemIf its due: 73.1 against Jev's 74.4 in JevBench v1.3.0, second on the board, and ahead on the 146-decision judge tier.

Der Abstand konzentriert sich auf zwei Bereiche. Bei 220 schwierigen Entscheidungen erreicht Jev 74,1 % und SemIf 59,5 %, ein Unterschied von 14,6 Punkten. Bei der Kalibrierung liegt Jev mit 82,7 gegenüber 72,6 vorn, weil seine Wahrscheinlichkeiten für die Entscheidungsschnittstelle trainiert werden, statt sie direkt aus einem eingefrorenen Modell auszulesen.

The third gap is operational. SemIf's low per-decision estimate assumes a rented GPU that stays busy. Idle GPUs bill the same as busy ones, so bursty traffic moves that number in a hurry.

Datengrenze

SemIf bleibt in deinem Netzwerk; Jev sendet Anfragen an eine gehostete API.

Betriebsmodell

Bei SemIf entfallen API-Gebühren, dafür übernimmst du GPU, Serving, Überwachung und Kalibrierung.

Entscheidungsformat

Beide eignen sich besonders, wenn Software eine typisierte Auswahl, Bewertung oder Ja-Nein-Entscheidung benötigt.

Offene Implementierung

Was SemIf tatsächlich ist

SemIf nimmt einen unstrukturierten Kontext, zur Anfragezeit definierte Kriterien und typisierte Optionen entgegen. Es führt einen Vorwärtsdurchlauf durch ein offenes Modell aus und liest die nativen Logits der Optionen aus, statt einen Antwortsatz zu generieren, JSON zu parsen und anschließend zu validieren.

Die primäre Benchmark-Konfiguration verwendet Qwen3.5-4B. Das Projekt unterstützt außerdem Qwen3-0.6B, MiniCPM5-2B und Qwen3-Reranker-4B. Der Code steht unter MIT; für Modellgewichte gelten weiterhin die jeweiligen Upstream-Lizenzen.

SemIf auf GitHub ansehen

Selbst gehostet

Führe das Modell auf deiner GPU aus oder miete eine, wenn das Volumen es rechtfertigt.

Browserdemo

Teste eine WebGPU-Version direkt im Browser – ohne Warteliste.

Direkte Logits

Gibt typisierte Optionswahrscheinlichkeiten ohne autoregressive Ausgabeschleife zurück.

Datenschutz durch Architektur

Halte Kontext und Entscheidungskriterien in deinem Netzwerk.

SemIf hieß zuvor OpenJev. Es ist ein unabhängiges Projekt und steht weder mit TypeSafe oder Jev AI in Verbindung noch wird es von ihnen unterstützt.

Welches Modell solltest du wählen?

Wähle nach deinen Rahmenbedingungen

Jev passt, wenn

  • Der Traffic schwankt stark oder du möchtest keine GPU-Serving-Infrastruktur betreiben.
  • Die Eingaben umfassen lange, verrauschte oder umstrittene Fälle, bei denen die schwierige Stufe entscheidend ist.
  • Du brauchst Schwellenwerte, die vom ersten Tag an funktionieren – ohne vorherige Kalibrierung.

SemIf passt, wenn

  • Du besitzt ungenutzte GPU-Kapazität oder kannst eine gemietete GPU dauerhaft auslasten.
  • Die Daten dürfen dein Netzwerk aus rechtlichen Gründen nicht verlassen.
  • Die meisten Entscheidungen sind einfach, Standard- oder Bewertungsfälle und du kannst lokal kalibrieren.

Der faire Vergleich

Teste Jev mit den Fällen, über die ihr tatsächlich diskutiert.

Eine Rangliste gibt eine erste Orientierung. Aussagekräftiger sind deine eigenen schwierigen Fälle.

Jev-Spielwiese öffnen

Häufige Fragen

FAQ: Jev und SemIf

Ist SemIf dasselbe wie OpenJev?+

SemIf ist der aktuelle Name des früher von TheoLeeCJ entwickelten Projekts OpenJev. Andere, nicht verwandte Projekte verwenden ebenfalls den Namen openJev.

Ist SemIf so genau wie Jev?+

In den meisten Stufen liegt SemIf nahe an Jev und in einer vorn. In JevBench v1.3.0 ist SemIf bei einfachen Entscheidungen gleichauf, bei Standardfällen knapp dahinter, gewinnt die Bewertungsstufe mit 95,2 % zu 94,5 % und liegt bei schwierigen Fällen mit 59,5 % zu 74,1 % zurück.

Welche Hardware benötige ich für SemIf?+

Die veröffentlichten Werte basieren auf einem 4B-Modell mit einer RTX 3090. Kleinere unterstützte Modelle laufen auch auf schwächerer Hardware. Es gibt zudem eine WebGPU-Browserdemo; für produktiven Durchsatz wird jedoch GPU-Kapazität vorausgesetzt.

Liefert SemIf kalibrierte Wahrscheinlichkeiten?+

SemIf liefert Wahrscheinlichkeiten abhängig von den vorgegebenen Optionen. Das Projekt bietet Temperaturkalibrierung; die README empfiehlt, die Wahrscheinlichkeiten für den jeweiligen Entscheidungs-Workload anzupassen und zu validieren.

Was kostet der Betrieb von SemIf?+

JevBench schätzt etwa 0,022 US-Dollar pro 1.000 Entscheidungen bei dauerhaft ausgelasteter GPU. Leerlaufzeiten und der technische Aufwand für den eigenen Betrieb sind nicht enthalten.

Die Zahlen stammen aus den obigen öffentlichen Quellen, geprüft am 22. September 2026. SemIf und alle weiteren auf dieser Seite genannten Produkte gehören ihren jeweiligen Eigentümern.