JEV比較 · JEVBENCH V1.3.0 · 2026年9月22日更新
JevとSemIfの比較
比較中で最も強力なオープン再実装と、まだ及ばない点。
このサイトのモデル
Jev 1.13.0
TypeSafe · System Oneモデル
自分で運用する必要がなく、難しいケースでも優位です。
比較対象
SemIf
TheoLeeCJ · Qwen3.5-4B上のオープンなlogit reader
手持ちのGPUでJevとの差を1.3ポイントまで縮めます。
ベンチマーク
同一条件で測定したJevBench v1.3.0
52のシステムを同一の方法で評価したため、各バーを比較できます。ベンダーが個別に公開した数値とは異なり、横並びで比較可能です。
総合スコア
高いほど良好
JevBench v1.3.0
上位3つの差は1.4ポイント以内ですが、その後は大きく離れます。総合スコアでは各システムの違いが見えにくいため、下の2つの図で内訳を示します。
難易度別の正解率
判断結果に差が出るところ
簡単
単純なケース72件
標準
日常的なケース96件
評価
評価形式の呼び出し146件
難問難問
実際に曖昧なケース220件
簡単な判断と標準的な判断ではほとんど差がありません。難問の段階でシステム間の違いが表れます。
もう1つの指標:コスト
The composite also weighs cost, scored from each system's public list price. Jev places last on that axis, but the benchmark does not turn a single price into a recommendation: bursty traffic and idle GPU time change the economics of self-hosting.
Jevの料金を見るランキング
全システムの比較
上に性能スコアを図示しました。ここでは順位とデプロイの詳細を示します。JevとSemIfを強調しています。
JevBench v1.3.0は2026年9月21日、同じ534件の判断(簡単72件、標準96件、評価146件、難問220件)を使い、一度に1リクエストずつ52システムを評価しました。
機能ごとの比較
JevとSemIfを比較
それぞれの得意分野
実用上のトレードオフ
総合スコアではSemIfもJevにかなり近い結果です。重要な違いは順位より、インフラ、データ、キャリブレーション作業を誰が担うかです。
Jevの強み
- 難問の正解率:74.1%対59.5%。
- 初期状態のキャリブレーションが優位:82.7対72.6。
- GPU、サービング基盤、容量計画、待機コストの運用が不要です。
- 1リクエストあたり64kのコンテキストと、本番用レート制限が公開されています。
SemIfの強み
- Judge-tier accuracy: 95.2% against Jev's 94.5%.
- コードを読んでフォーク・監査でき、管理下の重みで実行できるMITライセンス。
- GPUを稼働させている間は、呼び出しごとの料金がありません。
- WebGPUブラウザーデモを含め、オフラインでも動作します。
分析
差が出る領域は限られている
Give SemIf its due: 73.1 against Jev's 74.4 in JevBench v1.3.0, second on the board, and ahead on the 146-decision judge tier.
差は主に2点に集中しています。難しい判断220件ではJevが74.1%、SemIfが59.5%で、14.6ポイントの差があります。キャリブレーションではJevが82.7、SemIfが72.6です。Jevは固定モデルから確率を直接読み取るのではなく、判断インターフェース向けに学習しています。
The third gap is operational. SemIf's low per-decision estimate assumes a rented GPU that stays busy. Idle GPUs bill the same as busy ones, so bursty traffic moves that number in a hurry.
データの境界
SemIfはネットワーク内で動作し、Jevはホスト型APIにリクエストを送信します。
運用モデル
SemIfはAPI費用の代わりに、GPU、サービング、監視、キャリブレーションの運用が必要です。
判断形式
どちらも、ソフトウェアに型付きの選択、スコア、Yes/No判断が必要な場面に適しています。
オープンな実装
SemIfの実態
SemIfは非構造化コンテキスト、リクエスト時に指定する条件、型付き選択肢を受け取ります。文章を生成してJSONを解析・検証する代わりに、オープンモデルの順方向計算を行い、選択肢のネイティブlogitを読み取ります。
主なベンチマーク構成ではQwen3.5-4Bを使います。Qwen3-0.6B、MiniCPM5-2B、Qwen3-Reranker-4Bにも対応しています。コードはMITライセンスですが、モデル重みには各上流ライセンスが適用されます。
GitHubでSemIfを見るセルフホスト
自分のGPUで実行するか、利用量に応じてGPUをレンタルします。
ブラウザーデモ
ウェイトリストなしで、WebGPU版をブラウザーから試せます。
直接logit
自己回帰による出力生成を行わず、型付きの選択肢確率を返します。
設計段階からプライベート
コンテキストと判断基準をネットワーク内に保持できます。
SemIfは以前OpenJevという名称でした。独立したプロジェクトで、TypeSafeやJev AIとの提携・推奨関係はありません。
どちらを選ぶべき?
制約に合わせて選ぶ
Jevを選ぶケース
- トラフィックの変動が大きい、またはGPUサービング基盤を運用したくない。
- 難問の段階が重要になる、長文・ノイズの多い・意見が分かれる入力を扱います。
- キャリブレーション作業後ではなく、初日から使えるしきい値が必要です。
SemIfを選ぶケース
- 未使用のGPUを所有している、またはレンタルGPUを常時稼働させられる。
- 法的要件により、データをネットワーク外に出せません。
- 判断の大半が簡単・標準・評価レベルで、ローカルで調整できます。
率直な比較
実際に議論しているケースでJevを試してください。
スコアボードは目安になります。実際に難しいケースで試すほうが確実です。
よくある質問
JevとSemIfに関するFAQ
SemIfはOpenJevと同じですか?+
SemIfはTheoLeeCJの旧OpenJevプロジェクトの現在の名称です。openJevという名前を使う無関係なプロジェクトもあります。
SemIfの精度はJevと同等ですか?+
多くの段階でJevに近く、1項目では上回ります。JevBench v1.3.0では簡単な判断は同等、標準判断はわずかに劣り、評価段階では95.2%対94.5%で勝ち、難問では59.5%対74.1%で下回ります。
SemIfの実行に必要なハードウェアは?+
公表値は4BモデルをRTX 3090で実行した結果です。対応する小型モデルならより低い性能の機器でも動作し、WebGPUのブラウザーデモもありますが、本番の処理量にはGPUが必要です。
SemIfはキャリブレーション済み確率を返しますか?+
指定した選択肢を条件とする確率を返します。温度キャリブレーション機能があり、READMEでは実際のワークロードで確率を調整・検証するよう推奨しています。
SemIfの運用コストはいくらですか?+
JevBenchの推定では、GPUを常時稼働させた場合、判断1,000件あたり約0.022ドルです。GPU待機時間や自前運用のエンジニアリングコストは含みません。
数値は2026年9月22日時点で上記の公開情報から引用しています。SemIfおよびこのページに記載された製品は、それぞれの権利者に帰属します。