実用比較 · JevBench v1.3.0 · 2026年9月22日更新
Jev vs OpenJev
互換性のある考え方を共有する2つの意思決定システム。ホスト型のJevとオープンソースのOpenJevサーバーの実際の違いを紹介します。
このサイトのモデル
Jev 1.13.0
TypeSafe · System Oneモデル
74.4
JevBench総合 · 1位
このプレイグラウンドで利用されるホスト型意思決定モデル。
オープンソース
OpenJev
razorback16 / Codiv · DiffusionGemma 26B-A4B
66.4
JevBench総合 · 11位
自分でホストするか、Codiv経由で実行できるJev互換の意思決定サーバー。
実行環境
ホスト型の本番API
24GB GPUまたはApple Siliconでセルフホスト
リクエスト形式
元の /v1/systemone
TypeSafe SDKと通信形式に互換
入力
テキストのみ
テキストと最大8枚の画像
選択肢の数
最大255
最大128
確信度
キャリブレーション済み確率
エントロピーから算出した確信度
思考モード
非対応
対応(品質とレイテンシのトレードオフあり)
このページでいうOpenJevはrazorback16のDiffusionGemmaベースのプロジェクトであり、この名称を使ったすべてのプロジェクトを指すものではありません。
同じ条件で測定
単一スコアよりも、ベンチマークの背景が重要
JevBench v1.3.0では、両システムを同じ意思決定セットで評価しました。バランス型の設定ではJevが優位ですが、思考モードを有効にするとOpenJevの性能が向上します。
総合スコア
知能、キャリブレーション、速度、コストの幾何平均。
Jev
74.4
OpenJev
66.4
公開比較ではJevが1位、OpenJevが11位です。
性能
数値が高いほど良好
知能
正しい回答を選べる割合
85.7 / 79.2
キャリブレーション
0.8が約80%を意味するか
82.7 / 64.8
速度
測定された応答時間
83.3 / 83.2
判断の難易度別正解率
簡単
単純なケース72件
標準
日常的なケース96件
評価
評価形式の呼び出し146件
難問
実際に曖昧なケース220件
思考モードでは、OpenJevは知能スコア88.0、難問カテゴリで78.2%を報告しています。標準構成との直接比較ではなく、異なる運用条件での結果です。
数値は比較ページと公開情報から引用しています。本番環境で判断する前に、実際のワークロードで検証してください。
機能ごとの比較
同じ形式、異なる運用モデル
OpenJevは意図的にJevと同じ通信形式を採用しています。実質的な違いは、リクエストがコードを離れた後に現れます。
| 項目 | Jev 1.13.0 | OpenJev |
|---|---|---|
| 概要 | TypeSafeのホスト型System Oneモデル | DiffusionGemma 26B-A4B-itを使うセルフホスト型意思決定サーバー |
| ライセンス | プロプライエタリ、ホスト型 | Apache-2.0、重みはNVIDIAとGoogleが提供 |
| リクエスト形式 | POST /v1/systemone | 同じ形式。openjev-latestとjev-latestを利用可能 |
| 質問タイプ | Noul、Choice、Scoreを並列で処理 | Noul、最大128候補のChoice、2〜10段階のScore |
| 入力 | テキスト、JSONオブジェクト、配列 | 1リクエストにつきテキストと最大8枚の画像 |
| スキーマ外の回答 | 型付き回答のみ | モデルが回答枠を埋めるため、構造上発生しない |
| 不確実性の扱い | 回答ごとにキャリブレーション済み確率 | エントロピーが高い場合、最大4回再評価して平均化 |
| ハードウェア | 不要(API呼び出し) | vLLM用の24GB NVIDIA GPU、またはMLX用に16GB以上空きのあるApple Silicon |
| 実行コスト | Jev AIクレジットで従量制 | GPUレンタルで判断1,000件あたり約0.066ドル、またはCodiv経由で無料 |
トレードオフ
それぞれの得意分野
常に優れた一方があるわけではありません。マネージド利用、キャリブレーション済み確信度、画像入力、セルフホスティング、運用コストのどれを重視するかで選びます。
Jevが適するケース
- 独自のキャリブレーション層を用意せず、そのまま使える確信度が必要。
- ランキング構成の難問正解率を重視(74.1%対65.5%)。
- 1つのChoiceで最大255候補を扱い、GPU、vLLM、量子化チェックポイントを運用したくない。
- 本番ロジックに簡単に固定できる、安定したホスト構成が必要。
- 実験から実際のAPIリクエストまでを素早く進めたい。
OpenJevが適するケース
- TypeSafe SDKの置き換えとして使い、ベースURLだけを変えて同じリクエスト形式を維持したい。
- 1つの判断リクエストで最大8枚の画像を入力したい。
- 難問で既定構成を上回る可能性のある思考モードを使いたい。
- モデルが回答欄に直接書き込まない、構造的に型付けされた回答経路が必要。
- 自社ネットワークやApple Siliconで動かせるApache-2.0のコードと重みが必要。
リポジトリから見る
razorback16のOpenJevが提供するもの
OpenJevはモデルチェックポイントにとどまらず、vLLMとMLXバックエンドを備えたDiffusionGemmaベースの小型意思決定サーバーです。
GitHubリポジトリを開く互換API
POST /v1/systemone とOpenAI形式の /v1/chat/completions
バックエンド
NVIDIA GPU向けvLLM、Apple Silicon向けMLX
デプロイ
DockerまたはローカルPythonプロセス。Codiv経由で無料ホスト利用も可能
ライセンス
Apache-2.0
OpenJevは独立したプロジェクトで、TypeSafe AIとの提携や推奨関係はありません。
どちらを使う?
最も重要な制約から考える
デプロイの境界や、プロダクトが必要とする不確実性の扱い方に合った意思決定モデルを選んでください。
Jevを選ぶケース
- 確率に基づいて分岐し、その意味がすぐ分かる状態にしたい。
- 26Bの拡散モデルを運用したり、デノイズ手順を調整したりしたくない。
- 入力はテキストで、安定したマネージド構成を求めている。
OpenJevを選ぶケース
- 画像を含む判断、または推論用の計算予算が有効なケース。
- GPU環境がすでにある、またはデータを社内ネットワーク内に保持する必要がある。
- ラベル付きの独自データで確信度のしきい値を検証する予定。
最も早い答えは、自分のテストセットから
実際に議論しているケースでJevを試す
プレイグラウンドで判断が難しいケースをいくつか実行し、環境に合ったOpenJev構成と比較してください。
FAQ
JevとOpenJevについて
TypeSafe SDKからOpenJevを呼び出せますか?+
razorback16のサーバーでは可能です。/v1/systemoneの通信形式を実装し、Jev互換のモデルエイリアスを受け付けます。
OpenJevの精度はJevと同等ですか?+
ランキング構成では、難問とキャリブレーションでOpenJevはJevを下回ります。思考モードは異なる運用条件のため、個別に評価してください。
OpenJevに必要なハードウェアは?+
リポジトリでは、約24GBのGPUメモリーを備えたNVIDIA環境、または約16GB以上の空きメモリーがあるApple Silicon環境が案内されています。
OpenJevはJevの代わりになりますか?+
画像、セルフホスティング、Apache-2.0が重要な一部の用途ではエンドポイントを置き換えられます。ただし、ハードウェア運用、思考モード、キャリブレーションは異なります。
OpenJevおよびこのページに記載されている他のプロジェクトは、それぞれの権利者に帰属します。数値は公開情報から引用しています。