Vergleich von Entscheidungsmodellen · Quellen geprüft am 27. September 2026

Jev vs AnyJev

Beide liefern strukturierte Entscheidungen und Wahrscheinlichkeiten. Jev ist ein sofort nutzbares gehostetes Modell; AnyJev ist ein Open-Source-Toolkit, das ein selbst betriebenes offenes LLM für Entscheidungen nutzt.

Gehostetes Modell · TypeSafe

Jev

Zustand und typisierte Fragen an eine API senden und Antworten samt Wahrscheinlichkeiten erhalten. Ein eigenes Modell oder einen Kopf pro Frage müssen Sie nicht betreiben bzw. anpassen.

Open-Source-Toolkit · Nokia Applied Research

AnyJev

Ein offenes LLM beantwortet Auswahl-, Ja/Nein- und Bewertungsfragen. L0 startet ohne Labels; später können Kalibrierung oder ein fragespezifischer Kopf angepasst werden.

Auf einen Blick

Die praktischen Unterschiede

Die Fragetypen sind ähnlich, doch Modellbetrieb und Aufwand für verlässliche Wahrscheinlichkeiten unterscheiden sich.

AspektJevAnyJev
BereitstellungGehostete Produktions-APIPython-Toolkit auf einem eigenen offenen LLM; unterstützt transformers und vLLM
AusgabenChoice, Noul (Ja/Nein) und Score; mehrere Fragen pro AnfrageAuswahl-, Ja/Nein- und Bewertungsentscheidungen mit Wahrscheinlichkeitsverteilungen
EinstiegAPI ohne aufgabenspezifische Labels nutzenL0 benötigt keine Labels und korrigiert Positions- sowie Label-Prior-Verzerrungen
KonfidenzKalibrierte Wahrscheinlichkeiten für nachgelagerte EntscheidungenL0 ist nicht kalibriert; L1 passt eine Temperatur an, L2 einen Auslesekopf
AufgabenlabelsKein eigener Kopf pro Frage nötigL1: etwa 100–500 Labels; L2: etwa 100–300 je Frage und Modell
BetriebAPI-Integration; die Modellinfrastruktur wird gehostetBasismodell und Serving selbst betreiben; L2 benötigt Hidden States
VerfügbarkeitKommerzieller gehosteter DienstProjektcode unter Apache-2.0; Lizenzen der Basismodelle gelten weiterhin

AnyJev-Methode

Was die drei Stufen hinzufügen

AnyJev kann ohne Trainingsdaten starten, doch jede Stufe bietet eine andere Aussagekraft der Wahrscheinlichkeiten.

L0

Keine Labels

Mittelt über Optionsreihenfolgen und korrigiert Label-Priors. Verbessert rohe Logits, kalibriert die Unsicherheit aber nicht.

L1

100–500 Labels

Ergänzt L0 um eine fragespezifische Temperaturkalibrierung. Die Reihenfolge der Antworten ändert sich dabei nicht.

L2

100–300 Labels

Passt einen geschlossenen Auslesekopf auf einem mittleren Hidden State an, ohne die Gewichte des Basismodells zu ändern. Der Kopf gilt nur für eine Frage und ein Modell.

Die README beschreibt auch einen Modus mit rohen Logits. Das derzeitige Buchstaben-Readout unterstützt höchstens 26 Optionen; ein Span-Readout steht auf der Roadmap.

Veröffentlichte Ergebnisse

Zahlen im jeweiligen Kontext lesen

AnyJev meldet nach Anpassung eines L2-Kopfs auf Qwen3-8B eine höhere Übereinstimmung mit Lehrer-Labels. Das belegt die Methode, ist aber kein gemessener Produktionsvergleich mit Jev.

Das Repository zitiert einen von Jevs Autoren veröffentlichten Wert auf demselben Datensatz, hat Jev aber nach eigener Angabe nicht erneut getestet. JevBench auf dieser Website verwendet einen anderen Benchmark. Die Werte ergeben zusammen keinen direkten Vergleich.

Von AnyJev berichtet · Qwen3-8B

64.7%

L0-Genauigkeit

77.1%

L2-Genauigkeit

LocalLLaMA/typed-decisions: 20 Fragen, 300 Labels je Frage, 2.000 zurückgehaltene Entscheidungen. Genauigkeit bedeutet Übereinstimmung mit einem Lehrer-LLM, nicht mit unabhängiger Ground Truth.

Entscheidungshilfe

Was passt zu Ihrem Workflow?

Jev für eine verwaltete API

Geeignet, wenn Sie sofort typisierte Entscheidungen und Wahrscheinlichkeiten brauchen, mehrere Fragen pro Aufruf stellen und weder ein LLM betreiben noch pro Frage Labels sammeln möchten.

Jev-Modell ansehen

AnyJev für Modellkontrolle

Geeignet, wenn Sie ein offenes LLM selbst hosten, Basismodell und Betrieb kontrollieren und Wahrscheinlichkeiten für Ihre eigenen Fragen prüfen oder anpassen können.

AnyJev-Stufen lesen

Häufige Fragen zu Jev und AnyJev

Sind AnyJev und Jev dasselbe Projekt?+

Nein. AnyJev ist ein unabhängiges Open-Source-Forschungsprojekt von Nokia Applied Research und weder mit TypeSafe noch mit dieser Website verbunden.

Funktioniert AnyJev ohne Trainingslabels?+

Ja. L0 braucht keine Labels, seine Wahrscheinlichkeiten sind aber nicht kalibriert. L1 und L2 benötigen markierte Beispiele pro Frage, um zu kalibrieren oder einen Kopf anzupassen.

Ist AnyJev genauer als Jev?+

Die zitierten Quellen enthalten keinen unabhängig wiederholten Produktionsvergleich unter gleichen Bedingungen. AnyJev veröffentlicht Qwen-Ergebnisse und zitiert einen Jev-Wert von Jevs Autoren. Für eine Auswahl nach Genauigkeit sollten Sie beide auf Ihren eigenen Fällen testen.

Quellen geprüft am 27. September 2026. AnyJev und TypeSafe gehören ihren jeweiligen Eigentümern. Veröffentlichte Werte können sich mit Modell, Datensatz und Serving ändern.