JEV比較 · JEVBENCH V1.3.0 · 2026年9月22日更新

JevとSemIfの比較

比較中で最も強力なオープン再実装と、まだ及ばない点。

このサイトのモデル

Jev 1.13.0

TypeSafe · System Oneモデル

74.4

自分で運用する必要がなく、難しいケースでも優位です。

JevBench v1.3.0 · 1位

比較対象

SemIf

TheoLeeCJ · Qwen3.5-4B上のオープンなlogit reader

73.1

手持ちのGPUでJevとの差を1.3ポイントまで縮めます。

JevBench v1.3.0 · 2位
ホスト型API(自分で運用する必要なし)
実行環境
所有またはレンタルしたGPUでセルフホスト
独自モデル、ホスト型
ライセンス
オープンウェイト上のMITライセンスのコード
正解率94.5%
評価形式のケース
正解率95.2%
正解率74.1%
最難関のテストケース
正解率59.5%
初期状態で調整済み — 82.7 / 100
確率
独自ワークロードでの調整が必要 — 72.6 / 100
Sent to TypeSafe's API
データの送信先
ネットワーク外に送信されません

ベンチマーク

同一条件で測定したJevBench v1.3.0

52のシステムを同一の方法で評価したため、各バーを比較できます。ベンダーが個別に公開した数値とは異なり、横並びで比較可能です。

総合スコア

高いほど良好

JevBench v1.3.0

#1 Jev
74.4
#2 SemIf
73.1
#3 djev
73.0
#11 OpenJev
66.4
#33 Laya
54.4

上位3つの差は1.4ポイント以内ですが、その後は大きく離れます。総合スコアでは各システムの違いが見えにくいため、下の2つの図で内訳を示します。

難易度別の正解率

判断結果に差が出るところ

簡単

単純なケース72件

Jev 100%SemIf 100%

標準

日常的なケース96件

Jev 99%SemIf 97.9%

評価

評価形式の呼び出し146件

Jev 94.5%SemIf 95.2%

難問難問

実際に曖昧なケース220件

Jev 74.1%SemIf 59.5%

簡単な判断と標準的な判断ではほとんど差がありません。難問の段階でシステム間の違いが表れます。

もう1つの指標:コスト

The composite also weighs cost, scored from each system's public list price. Jev places last on that axis, but the benchmark does not turn a single price into a recommendation: bursty traffic and idle GPU time change the economics of self-hosting.

Jevの料金を見る

ランキング

全システムの比較

上に性能スコアを図示しました。ここでは順位とデプロイの詳細を示します。JevとSemIfを強調しています。

モデル順位スコア測定レイテンシ実行環境
Jev 1.13.0 (TypeSafe)#174.4中央値0.65秒 / p95 0.72秒ホスト型の本番API
SemIf (Qwen3.5-4B)#273.1生値0.20秒 / 調整後0.55秒セルフホスト、RunPod GPU
djev (Maisa, DiffusionGemma)#373.0中央値0.24秒 / p95 0.31秒ホスト型API、無料プレビュー
OpenJev (razorback16)#1166.4生値0.24秒 / 調整後0.63秒セルフホスト、RunPod GPU
Laya (ModernBERT-large)#3354.4生値0.79秒 / 調整後1.72秒セルフホスト、CPU

JevBench v1.3.0は2026年9月21日、同じ534件の判断(簡単72件、標準96件、評価146件、難問220件)を使い、一度に1リクエストずつ52システムを評価しました。

機能ごとの比較

JevとSemIfを比較

項目Jev 1.13.0SemIf
概要TypeSafeのホスト型System Oneモデル、バージョンjev-1.13.0固定されたオープンモデル上で動くセルフホスト型logit reader
ライセンス独自モデル、ホスト型プロジェクトコードはMITライセンス、モデル重みには各上流ライセンスが適用
ベースモデル非公開、RLCDで追加学習主にQwen3.5-4B。Qwen3-0.6B、MiniCPM5-2B、Qwen3-Reranker-4Bにも対応
ハードウェア不要(API呼び出し)自前のGPUが必要。公表値はRTX 3090で測定
キャリブレーション確率を調整するために追加学習。JevBench 82.7指定した選択肢に依存し、ワークロードごとの調整が必要。JevBench 72.6
評価段階の正解率94.5%95.2% — この項目はSemIfが上回る
難問の正解率74.1%59.5%
実行コストJev AIクレジットによる従量課金。待機コストなしレンタルGPU稼働中は判断1,000件あたり約0.022ドル。待機中も課金

それぞれの得意分野

実用上のトレードオフ

総合スコアではSemIfもJevにかなり近い結果です。重要な違いは順位より、インフラ、データ、キャリブレーション作業を誰が担うかです。

Jevの強み

  • 難問の正解率:74.1%対59.5%。
  • 初期状態のキャリブレーションが優位:82.7対72.6。
  • GPU、サービング基盤、容量計画、待機コストの運用が不要です。
  • 1リクエストあたり64kのコンテキストと、本番用レート制限が公開されています。

SemIfの強み

  • Judge-tier accuracy: 95.2% against Jev's 94.5%.
  • コードを読んでフォーク・監査でき、管理下の重みで実行できるMITライセンス。
  • GPUを稼働させている間は、呼び出しごとの料金がありません。
  • WebGPUブラウザーデモを含め、オフラインでも動作します。

分析

差が出る領域は限られている

Give SemIf its due: 73.1 against Jev's 74.4 in JevBench v1.3.0, second on the board, and ahead on the 146-decision judge tier.

差は主に2点に集中しています。難しい判断220件ではJevが74.1%、SemIfが59.5%で、14.6ポイントの差があります。キャリブレーションではJevが82.7、SemIfが72.6です。Jevは固定モデルから確率を直接読み取るのではなく、判断インターフェース向けに学習しています。

The third gap is operational. SemIf's low per-decision estimate assumes a rented GPU that stays busy. Idle GPUs bill the same as busy ones, so bursty traffic moves that number in a hurry.

データの境界

SemIfはネットワーク内で動作し、Jevはホスト型APIにリクエストを送信します。

運用モデル

SemIfはAPI費用の代わりに、GPU、サービング、監視、キャリブレーションの運用が必要です。

判断形式

どちらも、ソフトウェアに型付きの選択、スコア、Yes/No判断が必要な場面に適しています。

オープンな実装

SemIfの実態

SemIfは非構造化コンテキスト、リクエスト時に指定する条件、型付き選択肢を受け取ります。文章を生成してJSONを解析・検証する代わりに、オープンモデルの順方向計算を行い、選択肢のネイティブlogitを読み取ります。

主なベンチマーク構成ではQwen3.5-4Bを使います。Qwen3-0.6B、MiniCPM5-2B、Qwen3-Reranker-4Bにも対応しています。コードはMITライセンスですが、モデル重みには各上流ライセンスが適用されます。

GitHubでSemIfを見る

セルフホスト

自分のGPUで実行するか、利用量に応じてGPUをレンタルします。

ブラウザーデモ

ウェイトリストなしで、WebGPU版をブラウザーから試せます。

直接logit

自己回帰による出力生成を行わず、型付きの選択肢確率を返します。

設計段階からプライベート

コンテキストと判断基準をネットワーク内に保持できます。

SemIfは以前OpenJevという名称でした。独立したプロジェクトで、TypeSafeやJev AIとの提携・推奨関係はありません。

どちらを選ぶべき?

制約に合わせて選ぶ

Jevを選ぶケース

  • トラフィックの変動が大きい、またはGPUサービング基盤を運用したくない。
  • 難問の段階が重要になる、長文・ノイズの多い・意見が分かれる入力を扱います。
  • キャリブレーション作業後ではなく、初日から使えるしきい値が必要です。

SemIfを選ぶケース

  • 未使用のGPUを所有している、またはレンタルGPUを常時稼働させられる。
  • 法的要件により、データをネットワーク外に出せません。
  • 判断の大半が簡単・標準・評価レベルで、ローカルで調整できます。

率直な比較

実際に議論しているケースでJevを試してください。

スコアボードは目安になります。実際に難しいケースで試すほうが確実です。

Jevプレイグラウンドを開く

よくある質問

JevとSemIfに関するFAQ

SemIfはOpenJevと同じですか?+

SemIfはTheoLeeCJの旧OpenJevプロジェクトの現在の名称です。openJevという名前を使う無関係なプロジェクトもあります。

SemIfの精度はJevと同等ですか?+

多くの段階でJevに近く、1項目では上回ります。JevBench v1.3.0では簡単な判断は同等、標準判断はわずかに劣り、評価段階では95.2%対94.5%で勝ち、難問では59.5%対74.1%で下回ります。

SemIfの実行に必要なハードウェアは?+

公表値は4BモデルをRTX 3090で実行した結果です。対応する小型モデルならより低い性能の機器でも動作し、WebGPUのブラウザーデモもありますが、本番の処理量にはGPUが必要です。

SemIfはキャリブレーション済み確率を返しますか?+

指定した選択肢を条件とする確率を返します。温度キャリブレーション機能があり、READMEでは実際のワークロードで確率を調整・検証するよう推奨しています。

SemIfの運用コストはいくらですか?+

JevBenchの推定では、GPUを常時稼働させた場合、判断1,000件あたり約0.022ドルです。GPU待機時間や自前運用のエンジニアリングコストは含みません。

数値は2026年9月22日時点で上記の公開情報から引用しています。SemIfおよびこのページに記載された製品は、それぞれの権利者に帰属します。