Jev AI

JEV-VERGLEICH · JEVBENCH V1.3.0 · AKTUALISIERT AM 22. SEPTEMBER 2026

Jev und Laya im Vergleich

Ein Modell, das du mit eigenen Daten feinabstimmst, im Vergleich zu einem, das sofort funktioniert.

Auf dieser Website

Jev 1.13.0

TypeSafe · System-One-Modell

74.4

Sofort einsatzbereit – ohne gelabelte Daten und ohne Trainingslauf.

JevBench v1.3.0 · Platz 1
vs.

Alternative

Laya

Convai Innovations · Apache-2.0 · Entscheidungsmodell mit 421 Mio. Parametern

54.4

Offene Gewichte, Antwortzeiten im zweistelligen Millisekundenbereich und besonders niedrige Betriebskosten.

JevBench v1.3.0 · Platz 33
Gehostete API
AUSFÜHRUNGSORT
Selbst gehostet mit Apache-2.0-Gewichten
Sofort einsatzbereit
OHNE FEINABSTIMMUNG
Für die Aufgabe muss es feinabgestimmt werden
Englisch; andere Sprachen mit geringerer Zuverlässigkeit
SPRACHEN
Englisch plus mehr als 100 Sprachen
64.000 Tokens pro Anfrage
KONTEXTFENSTER
512 Tokens pro Frage
74,1 % korrekt
SCHWIERIGSTE TESTFÄLLE
34,1 % korrekt
0,65 s Median bei der gehosteten API
ANTWORTZEIT
33–40 ms auf einer Tesla T4

Der Benchmark

JevBench v1.3.0 – einheitlich gemessen

Ein Benchmark hat alle 52 Systeme nach derselben Methode getestet. Daher sind diese Balken direkt miteinander vergleichbar – anders als herstellerseitig veröffentlichte Werte. Die Gesamtpunktzahl kombiniert Intelligenz, Kalibrierung, Geschwindigkeit und Kosten.

Gesamtpunktzahl

Höher ist besser

JevBench v1.3.0

#1 Jev
74.4
#2 SemIf
73.1
#3 djev
73.0
#11 OpenJev
66.4
#33 Laya
54.4

Die ersten drei liegen höchstens 1,4 Punkte auseinander; danach fällt das Feld deutlich ab. Die Gesamtpunktzahl verdeckt die tatsächlichen Unterschiede, deshalb schlüsseln die folgenden Diagramme sie auf.

Genauigkeit nach Schwierigkeitsgrad

Hier gehen die Entscheidungen auseinander

Einfach

72 unkomplizierte Fälle

Jev 100%Laya 94.4%

Standard

96 alltägliche Fälle

Jev 99%Laya 72.9%

Bewertung

146 Aufrufe im Evaluierungsstil

Jev 94.5%Laya 69.2%

SchwierigSchwierig

220 tatsächlich mehrdeutige Fälle

Jev 74.1%Laya 34.1%

Bei einfachen und mittleren Entscheidungen gibt es kaum Unterschiede. Erst bei schwierigen Fällen weichen die Systeme deutlich voneinander ab.

Die fehlende vierte Kennzahl: Kosten

The composite also weighs cost, scored from each system’s public list price. Laya is one of the cheapest systems to run, while Jev trades per-call credits for a hosted, ready-to-use model with no idle GPU to operate.

Jev-Preise ansehen

Die Rangliste

Alle Systeme im Vergleich

Oben sind die Leistungswerte dargestellt; hier folgen die zugehörige Rangliste und die Bereitstellungsdetails. Jev und Laya sind hervorgehoben.

ModellRangPunktzahlGemessene LatenzAusgeführt auf
Jev 1.13.0 (TypeSafe)#174.40,65 s Median / 0,72 s p95Gehostete Produktions-API
SemIf (Qwen3.5-4B)#273.10,20 s roh / 0,55 s angepasstSelbst gehostet, RunPod-GPU
djev (Maisa, DiffusionGemma)#373.00,24 s Median / 0,31 s p95Gehostete API, kostenlose Vorschau
OpenJev (razorback16)#1166.40,24 s roh / 0,63 s angepasstSelbst gehostet, RunPod-GPU
Laya (ModernBERT-large)#3354.40,79 s roh / 1,72 s angepasstSelbst gehostet, CPU

JevBench v1.3.0 bewertete am 21. September 2026 insgesamt 52 Systeme mit denselben 534 Entscheidungen (72 einfach, 96 Standard, 146 Bewertung, 220 schwierig), jeweils mit einer Anfrage.

Funktion für Funktion

Jev und Laya im direkten Vergleich

MerkmalJev 1.13.0Laya
Was es istGehostetes System-One-Modell von TypeSafe, Version jev-1.13.0Entscheidungskopf mit offenen Gewichten auf einem eingefrorenen ModernBERT/mmBERT-Encoder
LizenzProprietär und gehostetApache-2.0; Gewichte auf Hugging Face, Installation über PyPI
GrößeNicht veröffentlicht421 Mio. auf Englisch oder 322 Mio. multilingual
SprachenAm besten auf Englisch; andere Sprachen mit geringerer GenauigkeitEnglischer Checkpoint plus multilingualer Checkpoint für mehr als 100 Sprachen
Zero-Shot-Qualität85,7 bei Intelligenz in JevBench; ohne zusätzliches Training nutzbarBasis-Checkpoints müssen für den produktiven Einsatz feinabgestimmt werden
KalibrierungJevBench-Kalibrierungswert: 82,7ECE von 0,081 nach Temperaturkalibrierung in Convais Messung
Kontext64.000 Tokens pro Anfrage512 Tokens pro Frage; lange Kontexte können abgeschnitten werden
Optionen pro AuswahlKeine niedrige feste ObergrenzeAb etwa 20 Optionen sinkt die Leistung; 0,425 Genauigkeit bei einer Aufgabe mit 77 Labels
Latenz0,65 s Median bei der Produktions-API32,8–39,5 ms auf einer Tesla T4; 193–464 ms auf einer CPU
BetriebskostenAbrechnung nach Jev-AI-GuthabenKostenloses Self-Hosting; Benchmark-Schätzung: etwa 0,0029 US-Dollar pro 1.000 Entscheidungen

Worin jedes Modell besser ist

Der praktische Kompromiss

Laya punktet bei Kontrolle, Geschwindigkeit, Mehrsprachigkeit und Selbsthosting-Kosten. Jev punktet bei Zero-Shot-Qualität, langem Kontext und einem sofort verfügbaren zuverlässigen Entscheidungsweg.

Worin Jev punktet

  • Funktioniert ohne Training und gelabelte Daten.
  • Hard-tier accuracy: 74.1% against Laya’s 34.1%.
  • 64.000 Tokens Kontext pro Anfrage für lange Tickets, Dokumente und Traces.
  • Keine niedrige feste Obergrenze für die Anzahl der Auswahloptionen.

Worin Laya punktet

  • Zehnermillisekunden auf einer Tesla T4 und kein zusätzlicher Netzwerkhop beim Selbsthosting.
  • Mehr als 100 Sprachen mit dem multilingualen Checkpoint.
  • Apache-2.0-Gewichte, die feinabgestimmt und offline ausgeführt werden können.
  • Sehr geringe Zusatzkosten, wenn eine ausgelastete GPU ohnehin bezahlt ist.

Die Analyse

Zwei passende Modelle für unterschiedliche Anforderungen

Convai veröffentlicht starke Latenz- und Kalibrierungswerte für Laya: 32,8 ms auf einer Tesla T4 mit dem multilingualen Checkpoint und ein erwarteter Kalibrierungsfehler von 0,081 nach Temperaturkalibrierung. Das ist attraktiv für stabile Workflows mit hohem Volumen.

Der Haken ist ebenso wichtig: Bei unbekannten typisierten Entscheidungen liegen die Basis-Checkpoints nahe am Zufall und unter einer Mehrheitsklassen-Baseline. Laya wird interessant, wenn gelabelte Beispiele und ein stabiles Labelset vorliegen und du das Modell auf deine Aufgabe abstimmen kannst.

JevBench measured the untuned package on CPU and found 34.1% on hard decisions against Jev’s 74.1%. Long hard-tier states can also be truncated by Laya’s 512-token limit, while Jev accepts 64k tokens per request.

Datengrenze

Laya bleibt in deinem Netzwerk; Jev sendet Anfragen an eine gehostete API.

Betriebsmodell

Bei Laya entfallen API-Gebühren, dafür übernimmst du GPU, Serving, Überwachung und Kalibrierung.

Entscheidungsformat

Beide eignen sich besonders, wenn Software eine typisierte Auswahl, Bewertung oder Ja-Nein-Entscheidung benötigt.

Sprachabdeckung

Layas multilingualer Checkpoint ist die klare Wahl, wenn Englisch nicht ausreicht.

Offene Implementierung

Was Laya tatsächlich ist

Laya ist ein Entscheidungskopf auf einem eingefrorenen Encoder. Er bewertet die Optionen zur Anfragezeit, statt einen Satz zu generieren, JSON zu parsen und anschließend zu validieren. Der englische Haupt-Checkpoint hat 421 Mio. Parameter; der multilinguale mit 322 Mio. deckt mehr als 100 Sprachen ab.

Es ist für Ticket-Routing, Moderation, Schutzprüfungen, Rechnungsverarbeitung und die Beobachtbarkeit von Agent-Traces gedacht – als Klassifizierungsebene um einen LLM-Stack, nicht als LLM selbst.

Laya auf GitHub ansehen

Selbst gehostet

Führe die Gewichte ohne Gebühren pro API-Aufruf auf deiner GPU oder CPU aus.

Mehrsprachig

Leite mehr als 100 Sprachen über den mmBERT-Checkpoint.

Direkte Wahrscheinlichkeiten

Gibt typisierte Optionswahrscheinlichkeiten ohne autoregressive Ausgabeschleife zurück.

Datenschutz durch Architektur

Halte Kontext und Entscheidungskriterien bei Bedarf im eigenen Netzwerk.

Laya ist ein unabhängiges Open-Source-Projekt und steht weder mit TypeSafe oder Jev AI in Verbindung noch wird es von ihnen unterstützt.

Welches Modell solltest du wählen?

Wähle nach deinen Rahmenbedingungen

Jev passt, wenn

  • Du hast noch keine gelabelten Daten – so beginnen die meisten Projekte.
  • Fragen werden zur Anfragezeit definiert und lassen sich anpassen, sobald du die Aufgabe besser verstehst.
  • Die Eingaben sind lang oder eine Auswahl umfasst deutlich mehr als zwei Dutzend Optionen.

Laya passt, wenn

  • Du hast gelabelte Daten, ein stabiles Labelset und die Möglichkeit, lokal feinabzustimmen.
  • Du brauchst Unterstützung für andere Sprachen oder strenge Datenresidenz.
  • Das Volumen ist hoch und die Entscheidung eng genug gefasst, damit sich selbst gehostete Inferenz lohnt.

Der faire Vergleich

Teste Jev mit den Fällen, über die ihr tatsächlich diskutiert.

Eine Rangliste gibt eine erste Orientierung. Aussagekräftiger sind deine eigenen schwierigen Fälle.

Jev-Spielwiese öffnen

Häufige Fragen

FAQ: Jev und Laya

Ist Laya ein direkter Ersatz für Jev?+

No. They answer the same three question types, but Laya’s base checkpoints expect fine-tuning on your task. Jev is designed to work without a training run.

Ist Laya wirklich 7,8-mal schneller als Jev?+

On Convai’s hardware, yes: 32.8ms on a Tesla T4 versus 236–276ms cited for Jev. JevBench measured Laya on CPU, so its comparable raw latency is slower. Hardware and network placement explain most of the gap.

Unterstützt Laya weitere Sprachen?+

Ja. Der 322M-mmBERT-base-Checkpoint deckt mehr als 100 Sprachen ab – ein echter Vorteil, wenn Englisch nicht deine Hauptsprache ist.

Was kostet Laya?+

Die Gewichte stehen unter Apache-2.0 und können kostenlos selbst gehostet werden. JevBench schätzt die Rechenkosten auf etwa 0,0029 US-Dollar pro 1.000 Entscheidungen, zuzüglich Betrieb und Wartung.

Kann Laya lange Dokumente verarbeiten?+

Nicht am Stück. Laya ist auf 512 Tokens pro Frage begrenzt; JevBench stellte fest, dass lange Kontexte bei schwierigen Fällen abgeschnitten wurden. Jev akzeptiert 64.000 Tokens pro Anfrage.

Laya und alle weiteren auf dieser Seite genannten Produkte gehören ihren jeweiligen Eigentümern und sind nicht mit Jev AI verbunden. Die Zahlen stammen aus den oben genannten öffentlichen Quellen, geprüft am 22. September 2026; sie können sich mit der Weiterentwicklung von Modellen und Benchmarks ändern.