JEV比較 · JEVBENCH V1.3.0 · 2026年9月22日更新

JevとLayaの比較

自分のデータでファインチューニングするモデルと、そのまま使えるモデルを比較します。

このサイトのモデル

Jev 1.13.0

TypeSafe · System Oneモデル

74.4

ラベル付きデータも学習も不要で、初日から利用可能。

JevBench v1.3.0 · 1位

比較対象

Laya

Convai Innovations · Apache-2.0 · 421M判断ヘッド

54.4

オープンウェイト、数十ミリ秒の応答、低コストでの運用。

JevBench v1.3.0 · 33位
ホスト型API
実行環境
Apache-2.0の重みでセルフホスト
そのまま利用可能
ファインチューニング不要
タスクに合わせたファインチューニングが必要
英語が最適。他言語では精度が下がる
言語
英語と100以上の言語
1リクエストあたり64kトークン
コンテキスト長
質問あたり512トークン
正解率74.1%
最難関のテストケース
正解率34.1%
ホスト型APIで中央値0.65秒
応答時間
Tesla T4で33~40ms

ベンチマーク

同一条件で測定したJevBench v1.3.0

52のシステムを同じ方法で評価しているため、ベンダー公表値と異なり、各バーを直接比較できます。総合スコアは知能、キャリブレーション、速度、コストを組み合わせています。

総合スコア

高いほど良好

JevBench v1.3.0

#1 Jev
74.4
#2 SemIf
73.1
#3 djev
73.0
#11 OpenJev
66.4
#33 Laya
54.4

上位3つの差は1.4ポイント以内ですが、その後は大きく離れます。総合スコアでは各システムの違いが見えにくいため、下の2つの図で内訳を示します。

難易度別の正解率

判断結果に差が出るところ

簡単

単純なケース72件

Jev 100%Laya 94.4%

標準

日常的なケース96件

Jev 99%Laya 72.9%

評価

評価形式の呼び出し146件

Jev 94.5%Laya 69.2%

難問難問

実際に曖昧なケース220件

Jev 74.1%Laya 34.1%

簡単な判断と標準的な判断ではほとんど差がありません。難問の段階でシステム間の違いが表れます。

もう1つの指標:コスト

The composite also weighs cost, scored from each system’s public list price. Laya is one of the cheapest systems to run, while Jev trades per-call credits for a hosted, ready-to-use model with no idle GPU to operate.

Jevの料金を見る

ランキング

全システムの比較

上に性能スコアを図示しました。ここでは順位とデプロイの詳細を示します。JevとLayaを強調しています。

モデル順位スコア測定レイテンシ実行環境
Jev 1.13.0 (TypeSafe)#174.4中央値0.65秒 / p95 0.72秒ホスト型の本番API
SemIf (Qwen3.5-4B)#273.1生値0.20秒 / 調整後0.55秒セルフホスト、RunPod GPU
djev (Maisa, DiffusionGemma)#373.0中央値0.24秒 / p95 0.31秒ホスト型API、無料プレビュー
OpenJev (razorback16)#1166.4生値0.24秒 / 調整後0.63秒セルフホスト、RunPod GPU
Laya (ModernBERT-large)#3354.4生値0.79秒 / 調整後1.72秒セルフホスト、CPU

JevBench v1.3.0は2026年9月21日、同じ534件の判断(簡単72件、標準96件、評価146件、難問220件)を使い、一度に1リクエストずつ52システムを評価しました。

機能ごとの比較

JevとLayaを比較

項目Jev 1.13.0Laya
概要TypeSafeのホスト型System Oneモデル、バージョンjev-1.13.0固定されたModernBERT/mmBERTエンコーダー上で動くオープンウェイトの判断ヘッド
ライセンス独自モデル、ホスト型Apache-2.0。重みはHugging Faceで公開、PyPIからインストール可能
サイズ非公開英語版421M、多言語版322M
言語英語で最良。他言語では精度が低下英語チェックポイントと、100以上の言語に対応する多言語チェックポイント
ゼロショット品質JevBenchの知能スコア85.7。追加学習なしで利用可能本番タスクではベースチェックポイントのファインチューニングが必要
キャリブレーションJevBenchのキャリブレーションスコア:82.7Convaiの測定では温度スケーリング後のECEは0.081
コンテキスト1リクエストあたり64kトークン質問あたり512トークン。長いコンテキストは切り詰められる場合があります
選択肢あたりの候補数低い固定上限なし選択肢が約20を超えると性能が低下。77ラベルのタスクで正解率0.425
レイテンシ本番APIで中央値0.65秒Tesla T4で32.8~39.5ms、CPUで193~464ms
実行コストJev AIクレジットによる従量課金セルフホスト無料。ベンチマーク推定では判断1,000件あたり約0.0029ドル

それぞれの得意分野

実用上のトレードオフ

Layaは所有権、速度、多言語対応、セルフホストのコストで優れています。Jevはゼロショット品質、長いコンテキスト、すぐに使える信頼性の高い判断経路に強みがあります。

Jevの強み

  • ラベル付きデータや追加学習なしで動作します。
  • Hard-tier accuracy: 74.1% against Laya’s 34.1%.
  • 長いチケット、文書、トレースに対応する64kトークンのコンテキスト。
  • 選択肢数に低い固定上限はありません。

Layaの強み

  • Tesla T4で数十ミリ秒。セルフホストならネットワーク往復もありません。
  • 多言語チェックポイントで100以上の言語に対応。
  • ファインチューニングしてオフライン実行できるApache-2.0の重み。
  • GPUを十分に稼働させられるなら、追加コストを非常に低く抑えられます。

分析

異なる制約に合う2つのモデル

Convaiによると、多言語チェックポイントをTesla T4で実行したLayaは32.8msで、温度スケーリング後の期待キャリブレーション誤差は0.081です。大量かつ安定したワークフローには魅力的な性能です。

ただし注意点も重要です。未学習の型付き判断では基本チェックポイントの性能はランダムに近く、多数派クラスの基準を下回ります。ラベル付き例、安定したラベル集合、タスクに合わせた調整能力がある場合にLayaの利点が生きます。

JevBench measured the untuned package on CPU and found 34.1% on hard decisions against Jev’s 74.1%. Long hard-tier states can also be truncated by Laya’s 512-token limit, while Jev accepts 64k tokens per request.

データの境界

Layaはネットワーク内で動作し、Jevはホスト型APIにリクエストを送信します。

運用モデル

LayaはAPI費用の代わりに、GPU、サービング、監視、キャリブレーションの運用が必要です。

判断形式

どちらも、ソフトウェアに型付きの選択、スコア、Yes/No判断が必要な場面に適しています。

対応言語

英語以外の言語が必要なら、Layaの多言語チェックポイントが有力です。

オープンな実装

Layaの実態

Layaは固定エンコーダー上の判断ヘッドです。文を生成してJSONを解析・検証する代わりに、リクエスト時に指定された選択肢をスコアリングします。英語版は421Mパラメーター、多言語版は322Mで100以上の言語に対応します。

チケットのルーティング、モデレーション、ガードレール、請求書処理、エージェントトレースの可観測性を想定しています。LLMそのものではなく、その周囲の分類レイヤーです。

GitHubでLayaを見る

セルフホスト

自分のGPUまたはCPUで実行でき、API呼び出しごとの料金はありません。

多言語

mmBERTチェックポイントで100以上の言語をルーティングできます。

直接確率

自己回帰による出力生成を行わず、型付きの選択肢確率を返します。

設計段階からプライベート

必要に応じてコンテキストと判断基準をネットワーク内に保持できます。

Layaは独立したオープンソースプロジェクトで、TypeSafeやJev AIとの提携・推奨関係はありません。

どちらを選ぶべき?

制約に合わせて選ぶ

Jevを選ぶケース

  • まだラベル付きデータがありません。ほとんどのプロジェクトはここから始まります。
  • 質問はリクエスト時に定義でき、タスクの理解に合わせて変更できます。
  • 入力が長い、または選択肢が24個を大きく超えます。

Layaを選ぶケース

  • ラベル付きデータと安定したラベル集合があり、ローカルで調整できます。
  • 英語以外の言語対応、または厳格なデータ保管要件が必要です。
  • 利用量が多く、判断範囲が明確でセルフホスト推論の費用対効果が見込めます。

率直な比較

実際に議論しているケースでJevを試してください。

スコアボードは目安になります。実際に難しいケースで試すほうが確実です。

Jevプレイグラウンドを開く

よくある質問

JevとLayaに関するFAQ

LayaはJevの置き換えとして使えますか?+

No. They answer the same three question types, but Laya’s base checkpoints expect fine-tuning on your task. Jev is designed to work without a training run.

Layaは本当にJevの7.8倍速いですか?+

On Convai’s hardware, yes: 32.8ms on a Tesla T4 versus 236–276ms cited for Jev. JevBench measured Laya on CPU, so its comparable raw latency is slower. Hardware and network placement explain most of the gap.

Layaは他の言語にも対応していますか?+

はい。322MのmmBERT-baseチェックポイントは100以上の言語をカバーしており、英語が主言語でない場合に大きな利点です。

Layaの費用はいくらですか?+

重みはApache-2.0で、無料でセルフホストできます。JevBenchの推定計算コストは1,000件あたり約0.0029ドルで、運用・保守費用は別途かかります。

Layaは長い文書を処理できますか?+

一度に全体は処理できません。Layaは質問ごとに512トークンまでで、JevBenchでは難問の長いコンテキストが切り詰められました。Jevは1リクエストあたり64kトークンを受け付けます。

Layaおよびこのページに記載された製品は、それぞれの権利者に帰属し、Jev AIとは提携していません。数値は2026年9月22日時点で上記の公開情報から引用しており、モデルやベンチマークの進化に伴い変更される場合があります。