実用比較 · JevBench v1.3.0 · 2026年9月22日更新

Jev vs OpenJev

互換性のある考え方を共有する2つの意思決定システム。ホスト型のJevとオープンソースのOpenJevサーバーの実際の違いを紹介します。

このサイトのモデル

Jev 1.13.0

TypeSafe · System Oneモデル

74.4

JevBench総合 · 1位

このプレイグラウンドで利用されるホスト型意思決定モデル。

オープンソース

OpenJev

razorback16 / Codiv · DiffusionGemma 26B-A4B

66.4

JevBench総合 · 11位

自分でホストするか、Codiv経由で実行できるJev互換の意思決定サーバー。

実行環境

ホスト型の本番API

24GB GPUまたはApple Siliconでセルフホスト

リクエスト形式

元の /v1/systemone

TypeSafe SDKと通信形式に互換

入力

テキストのみ

テキストと最大8枚の画像

選択肢の数

最大255

最大128

確信度

キャリブレーション済み確率

エントロピーから算出した確信度

思考モード

非対応

対応(品質とレイテンシのトレードオフあり)

このページでいうOpenJevはrazorback16のDiffusionGemmaベースのプロジェクトであり、この名称を使ったすべてのプロジェクトを指すものではありません。

同じ条件で測定

単一スコアよりも、ベンチマークの背景が重要

JevBench v1.3.0では、両システムを同じ意思決定セットで評価しました。バランス型の設定ではJevが優位ですが、思考モードを有効にするとOpenJevの性能が向上します。

総合スコア

知能、キャリブレーション、速度、コストの幾何平均。

Jev

74.4

/

OpenJev

66.4

公開比較ではJevが1位、OpenJevが11位です。

性能

数値が高いほど良好

知能

正しい回答を選べる割合

85.7 / 79.2

キャリブレーション

0.8が約80%を意味するか

82.7 / 64.8

速度

測定された応答時間

83.3 / 83.2

判断の難易度別正解率

JevOpenJev

簡単

単純なケース72件

100%100%

標準

日常的なケース96件

99%95.8%

評価

評価形式の呼び出し146件

94.5%91.1%

難問

実際に曖昧なケース220件

74.1%65.5%

思考モードでは、OpenJevは知能スコア88.0、難問カテゴリで78.2%を報告しています。標準構成との直接比較ではなく、異なる運用条件での結果です。

数値は比較ページと公開情報から引用しています。本番環境で判断する前に、実際のワークロードで検証してください。

機能ごとの比較

同じ形式、異なる運用モデル

OpenJevは意図的にJevと同じ通信形式を採用しています。実質的な違いは、リクエストがコードを離れた後に現れます。

項目Jev 1.13.0OpenJev
概要TypeSafeのホスト型System OneモデルDiffusionGemma 26B-A4B-itを使うセルフホスト型意思決定サーバー
ライセンスプロプライエタリ、ホスト型Apache-2.0、重みはNVIDIAとGoogleが提供
リクエスト形式POST /v1/systemone同じ形式。openjev-latestとjev-latestを利用可能
質問タイプNoul、Choice、Scoreを並列で処理Noul、最大128候補のChoice、2〜10段階のScore
入力テキスト、JSONオブジェクト、配列1リクエストにつきテキストと最大8枚の画像
スキーマ外の回答型付き回答のみモデルが回答枠を埋めるため、構造上発生しない
不確実性の扱い回答ごとにキャリブレーション済み確率エントロピーが高い場合、最大4回再評価して平均化
ハードウェア不要(API呼び出し)vLLM用の24GB NVIDIA GPU、またはMLX用に16GB以上空きのあるApple Silicon
実行コストJev AIクレジットで従量制GPUレンタルで判断1,000件あたり約0.066ドル、またはCodiv経由で無料

トレードオフ

それぞれの得意分野

常に優れた一方があるわけではありません。マネージド利用、キャリブレーション済み確信度、画像入力、セルフホスティング、運用コストのどれを重視するかで選びます。

Jevが適するケース

  • 独自のキャリブレーション層を用意せず、そのまま使える確信度が必要。
  • ランキング構成の難問正解率を重視(74.1%対65.5%)。
  • 1つのChoiceで最大255候補を扱い、GPU、vLLM、量子化チェックポイントを運用したくない。
  • 本番ロジックに簡単に固定できる、安定したホスト構成が必要。
  • 実験から実際のAPIリクエストまでを素早く進めたい。

OpenJevが適するケース

  • TypeSafe SDKの置き換えとして使い、ベースURLだけを変えて同じリクエスト形式を維持したい。
  • 1つの判断リクエストで最大8枚の画像を入力したい。
  • 難問で既定構成を上回る可能性のある思考モードを使いたい。
  • モデルが回答欄に直接書き込まない、構造的に型付けされた回答経路が必要。
  • 自社ネットワークやApple Siliconで動かせるApache-2.0のコードと重みが必要。

リポジトリから見る

razorback16のOpenJevが提供するもの

OpenJevはモデルチェックポイントにとどまらず、vLLMとMLXバックエンドを備えたDiffusionGemmaベースの小型意思決定サーバーです。

GitHubリポジトリを開く

互換API

POST /v1/systemone とOpenAI形式の /v1/chat/completions

バックエンド

NVIDIA GPU向けvLLM、Apple Silicon向けMLX

デプロイ

DockerまたはローカルPythonプロセス。Codiv経由で無料ホスト利用も可能

ライセンス

Apache-2.0

OpenJevは独立したプロジェクトで、TypeSafe AIとの提携や推奨関係はありません。

どちらを使う?

最も重要な制約から考える

デプロイの境界や、プロダクトが必要とする不確実性の扱い方に合った意思決定モデルを選んでください。

1

Jevを選ぶケース

  • 確率に基づいて分岐し、その意味がすぐ分かる状態にしたい。
  • 26Bの拡散モデルを運用したり、デノイズ手順を調整したりしたくない。
  • 入力はテキストで、安定したマネージド構成を求めている。
2

OpenJevを選ぶケース

  • 画像を含む判断、または推論用の計算予算が有効なケース。
  • GPU環境がすでにある、またはデータを社内ネットワーク内に保持する必要がある。
  • ラベル付きの独自データで確信度のしきい値を検証する予定。

最も早い答えは、自分のテストセットから

実際に議論しているケースでJevを試す

プレイグラウンドで判断が難しいケースをいくつか実行し、環境に合ったOpenJev構成と比較してください。

FAQ

JevとOpenJevについて

TypeSafe SDKからOpenJevを呼び出せますか?+

razorback16のサーバーでは可能です。/v1/systemoneの通信形式を実装し、Jev互換のモデルエイリアスを受け付けます。

OpenJevの精度はJevと同等ですか?+

ランキング構成では、難問とキャリブレーションでOpenJevはJevを下回ります。思考モードは異なる運用条件のため、個別に評価してください。

OpenJevに必要なハードウェアは?+

リポジトリでは、約24GBのGPUメモリーを備えたNVIDIA環境、または約16GB以上の空きメモリーがあるApple Silicon環境が案内されています。

OpenJevはJevの代わりになりますか?+

画像、セルフホスティング、Apache-2.0が重要な一部の用途ではエンドポイントを置き換えられます。ただし、ハードウェア運用、思考モード、キャリブレーションは異なります。

OpenJevおよびこのページに記載されている他のプロジェクトは、それぞれの権利者に帰属します。数値は公開情報から引用しています。