判断モデルの比較 · 2026年9月27日に資料を確認
Jev vs AnyJev
どちらも構造化された判断と確率を返します。Jevはすぐ使えるホスト型モデル、AnyJevは自分で動かすオープンLLMを判断システムにするオープンソースのツールです。
ホスト型モデル · TypeSafe
Jev
状態と型付きの質問をAPIに送り、答えと確率を取得します。モデルの運用や質問ごとのヘッドの学習は不要です。
オープンソースのツール · Nokia Applied Research
AnyJev
オープンLLMで選択、はい/いいえ、スコアの判断を行います。L0はラベルなしで始められ、ラベルが集まれば校正や質問専用ヘッドを追加できます。
概要
実際の使い方の違い
扱う質問は似ていますが、モデルの運用と信頼できる確率を得るまでの作業が異なります。
| 項目 | Jev | AnyJev |
|---|---|---|
| 提供形態 | ホスト型の本番API | 自分のオープンLLMを使うPythonツール。transformersとvLLMに対応 |
| 出力 | Choice、Noul(はい/いいえ)、Score。1回のリクエストで複数の質問に対応 | 選択、はい/いいえ、スコアの判断と確率分布 |
| 導入時 | タスク固有のラベルなしでAPIを利用 | L0はラベル不要。選択肢の位置とラベルの事前確率による偏りを補正 |
| 確率 | 後続の判断に使える校正済みの確率 | L0は未校正。L1は温度を調整し、L2は読み出しヘッドを学習 |
| タスクのラベル | 質問ごとのヘッド学習は不要 | L1は約100~500件、L2は質問・モデルごとに約100~300件 |
| 運用 | APIを統合。モデル基盤はサービス側が運用 | 基盤モデルと配信環境を自分で運用。L2には隠れ状態が必要 |
| 利用形態 | 商用ホストサービス | プロジェクトのコードはApache-2.0。基盤モデルには各モデルのライセンスが適用 |
AnyJevの方式
3つのレベルで増えるもの
AnyJevは学習データなしで始められますが、各レベルで確率の意味は異なります。
L0
ラベル不要選択肢の順序を平均化し、ラベルの事前確率を補正します。生のlogitより改善しますが、不確実性は校正しません。
L1
100~500件L0に質問別の温度校正を追加します。答えの順位は変えません。
L2
100~300件中間層の隠れ状態に閉形式の読み出しヘッドを当てはめます。基盤モデルの重みは変えず、ヘッドは特定の質問とモデル専用です。
READMEには生のlogitを使うモードもあります。現在の文字ベースの読み出しは最大26選択肢に対応し、span読み出しは今後の予定です。
公開された結果
数値は測定条件と一緒に読む
AnyJevはQwen3-8BでL2ヘッドを学習した後、教師モデルのラベルとの一致率が上がったと報告しています。手法の参考にはなりますが、Jevとの本番環境での直接比較ではありません。
リポジトリは同じデータセットでJevの開発元が公開した値を引用していますが、Jevを再実行していないと明記しています。このサイトのJevBenchは別のベンチマークであり、単一の直接比較値として組み合わせられません。
AnyJevの報告 · Qwen3-8B
64.7%
L0の正解率
77.1%
L2の正解率
LocalLLaMA/typed-decisions:20問、各問300件のラベル、保留した2,000件の判断。ここでの正解率は教師LLMとの一致率で、独立した正解との一致率ではありません。
選び方
ワークフローに合うのは?
JevとAnyJevのよくある質問
AnyJevとJevは同じプロジェクトですか?+
いいえ。AnyJevはNokia Applied Researchによる独立したオープンソース研究プロジェクトで、TypeSafeやこのサイトとは提携していません。
AnyJevは学習ラベルなしで使えますか?+
はい。L0はラベル不要ですが、確率は未校正です。L1とL2は質問ごとのラベル付きサンプルを使い、校正またはヘッドの学習を行います。
AnyJevはJevより正確ですか?+
引用した資料には、同条件で独立に再測定した本番環境の比較はありません。AnyJevはQwenの結果を公開し、Jevの開発元の値を引用しています。正解率で選ぶ場合は、自分のデータで両者を試してください。
資料は2026年9月27日に確認しました。AnyJevとTypeSafeはそれぞれの権利者に帰属します。公開値はモデル、データ、配信方法により変わる場合があります。
