Vergleich von Entscheidungsmodellen · Quellen geprüft am 27. September 2026
Jev vs AnyJev
Beide liefern strukturierte Entscheidungen und Wahrscheinlichkeiten. Jev ist ein sofort nutzbares gehostetes Modell; AnyJev ist ein Open-Source-Toolkit, das ein selbst betriebenes offenes LLM für Entscheidungen nutzt.
Gehostetes Modell · TypeSafe
Jev
Zustand und typisierte Fragen an eine API senden und Antworten samt Wahrscheinlichkeiten erhalten. Ein eigenes Modell oder einen Kopf pro Frage müssen Sie nicht betreiben bzw. anpassen.
Open-Source-Toolkit · Nokia Applied Research
AnyJev
Ein offenes LLM beantwortet Auswahl-, Ja/Nein- und Bewertungsfragen. L0 startet ohne Labels; später können Kalibrierung oder ein fragespezifischer Kopf angepasst werden.
Auf einen Blick
Die praktischen Unterschiede
Die Fragetypen sind ähnlich, doch Modellbetrieb und Aufwand für verlässliche Wahrscheinlichkeiten unterscheiden sich.
| Aspekt | Jev | AnyJev |
|---|---|---|
| Bereitstellung | Gehostete Produktions-API | Python-Toolkit auf einem eigenen offenen LLM; unterstützt transformers und vLLM |
| Ausgaben | Choice, Noul (Ja/Nein) und Score; mehrere Fragen pro Anfrage | Auswahl-, Ja/Nein- und Bewertungsentscheidungen mit Wahrscheinlichkeitsverteilungen |
| Einstieg | API ohne aufgabenspezifische Labels nutzen | L0 benötigt keine Labels und korrigiert Positions- sowie Label-Prior-Verzerrungen |
| Konfidenz | Kalibrierte Wahrscheinlichkeiten für nachgelagerte Entscheidungen | L0 ist nicht kalibriert; L1 passt eine Temperatur an, L2 einen Auslesekopf |
| Aufgabenlabels | Kein eigener Kopf pro Frage nötig | L1: etwa 100–500 Labels; L2: etwa 100–300 je Frage und Modell |
| Betrieb | API-Integration; die Modellinfrastruktur wird gehostet | Basismodell und Serving selbst betreiben; L2 benötigt Hidden States |
| Verfügbarkeit | Kommerzieller gehosteter Dienst | Projektcode unter Apache-2.0; Lizenzen der Basismodelle gelten weiterhin |
AnyJev-Methode
Was die drei Stufen hinzufügen
AnyJev kann ohne Trainingsdaten starten, doch jede Stufe bietet eine andere Aussagekraft der Wahrscheinlichkeiten.
L0
Keine LabelsMittelt über Optionsreihenfolgen und korrigiert Label-Priors. Verbessert rohe Logits, kalibriert die Unsicherheit aber nicht.
L1
100–500 LabelsErgänzt L0 um eine fragespezifische Temperaturkalibrierung. Die Reihenfolge der Antworten ändert sich dabei nicht.
L2
100–300 LabelsPasst einen geschlossenen Auslesekopf auf einem mittleren Hidden State an, ohne die Gewichte des Basismodells zu ändern. Der Kopf gilt nur für eine Frage und ein Modell.
Die README beschreibt auch einen Modus mit rohen Logits. Das derzeitige Buchstaben-Readout unterstützt höchstens 26 Optionen; ein Span-Readout steht auf der Roadmap.
Veröffentlichte Ergebnisse
Zahlen im jeweiligen Kontext lesen
AnyJev meldet nach Anpassung eines L2-Kopfs auf Qwen3-8B eine höhere Übereinstimmung mit Lehrer-Labels. Das belegt die Methode, ist aber kein gemessener Produktionsvergleich mit Jev.
Das Repository zitiert einen von Jevs Autoren veröffentlichten Wert auf demselben Datensatz, hat Jev aber nach eigener Angabe nicht erneut getestet. JevBench auf dieser Website verwendet einen anderen Benchmark. Die Werte ergeben zusammen keinen direkten Vergleich.
Von AnyJev berichtet · Qwen3-8B
64.7%
L0-Genauigkeit
77.1%
L2-Genauigkeit
LocalLLaMA/typed-decisions: 20 Fragen, 300 Labels je Frage, 2.000 zurückgehaltene Entscheidungen. Genauigkeit bedeutet Übereinstimmung mit einem Lehrer-LLM, nicht mit unabhängiger Ground Truth.
Entscheidungshilfe
Was passt zu Ihrem Workflow?
Jev für eine verwaltete API
Geeignet, wenn Sie sofort typisierte Entscheidungen und Wahrscheinlichkeiten brauchen, mehrere Fragen pro Aufruf stellen und weder ein LLM betreiben noch pro Frage Labels sammeln möchten.
Jev-Modell ansehenAnyJev für Modellkontrolle
Geeignet, wenn Sie ein offenes LLM selbst hosten, Basismodell und Betrieb kontrollieren und Wahrscheinlichkeiten für Ihre eigenen Fragen prüfen oder anpassen können.
AnyJev-Stufen lesenHäufige Fragen zu Jev und AnyJev
Sind AnyJev und Jev dasselbe Projekt?+
Nein. AnyJev ist ein unabhängiges Open-Source-Forschungsprojekt von Nokia Applied Research und weder mit TypeSafe noch mit dieser Website verbunden.
Funktioniert AnyJev ohne Trainingslabels?+
Ja. L0 braucht keine Labels, seine Wahrscheinlichkeiten sind aber nicht kalibriert. L1 und L2 benötigen markierte Beispiele pro Frage, um zu kalibrieren oder einen Kopf anzupassen.
Ist AnyJev genauer als Jev?+
Die zitierten Quellen enthalten keinen unabhängig wiederholten Produktionsvergleich unter gleichen Bedingungen. AnyJev veröffentlicht Qwen-Ergebnisse und zitiert einen Jev-Wert von Jevs Autoren. Für eine Auswahl nach Genauigkeit sollten Sie beide auf Ihren eigenen Fällen testen.
Quellen geprüft am 27. September 2026. AnyJev und TypeSafe gehören ihren jeweiligen Eigentümern. Veröffentlichte Werte können sich mit Modell, Datensatz und Serving ändern.
