モデル概要 · 2026年9月22日更新
Jev-Omni
テキストだけでなく、画像、音声、動画を読み取る意思決定分類モデル。
Jev-OmniはJevの型付き判断という考え方を受け継ぎ、テキスト以外にも対応します。コンテキスト、質問、選択肢を渡すと、それぞれの選択肢に対する確率を返します。
マルチモーダル判断
Jev-Omni
質問
この動画を担当者にエスカレーションすべきですか?
ベースモデル
Gemma 4 12B IT
パラメーター数
12B
ライセンス
Apache-2.0
作者
akhilaaa3
対応できる入力と処理速度
4つのモダリティ、1つの判断インターフェース
最適化されたバックエンドを使い、ウォーム状態のH200で20件のリクエストを実行した際の公表中央値です。前処理とネットワーク時間は別途かかり、小規模なカードでは遅くなります。
テキスト
公表測定では約2,000トークン。
画像
1リクエストにつき画像1枚。
音声
最大30秒。ffmpegのインストールが必要です。
動画
16フレームをサンプリングして処理。
これらの数値は保証値ではなく参考値として扱ってください。ウォーム状態のH200で測定され、メディアの前処理とネットワーク時間は含まれていません。
JEV-OMNIの実態
チャットモデルではなく分類モデル
Jev-Omniはakhilaaa3による独立プロジェクトで、TypeSafeのモデルではありません。GoogleのGemma 4 12B ITに分類ヘッドを追加し、30,000件の意思決定問題でファインチューニングした統合モデルです。
分類ヘッドは指定された選択肢を評価し、確率分布を返します。説明や出力トークンは生成しないため、最終的な解釈とアクションはアプリケーション側で行います。
マルチモーダル入力はGemma 4自体の機能です。初回使用時にローダーが必要なコンポーネントを取得します。重みはApache-2.0ですが、モデルカードによると学習データセットの権利は同ライセンスの対象外です。
公開された結果
背景と合わせて見る実用的な数値
モデルカードには、シナリオまたはグループごとの単純平均と、全質問を対象としたマイクロ平均の両方が記載されています。
| ベンチマーク | 対象範囲 | 正解率 | マイクロ正解率 |
|---|---|---|---|
| DecisionBench Medium | 80シナリオ/293問 | 87.57% | 86.01% |
| JevBench(照合済みサブセット) | 195グループ/231件の判断 | 86.15% | 87.45% |
| MMAU | 1,000問 | — | 63.10% |
| MVBench | 14タスク/2,786問 | 53.10% | 53.09% |
規模と対応範囲
モデルカードに掲載された比較
参照スコアはモデルカードから転載しています。大規模モデルの数値は各モデルの公式発表であり、評価方法が異なる場合があると作者は説明しています。
| モデル | パラメーター数 | MMAU | MVBench | モダリティ |
|---|---|---|---|---|
| Jev-Omni | 12B | 63.10% | 53.10% | テキスト、画像、音声、動画 |
| Inkling | 合計975B/アクティブ41B | 77.20% | — | テキスト、画像、音声 |
| Qwen3.5-397B-A17B | 合計397B/アクティブ17B | — | 77.60% | テキスト、画像、動画 |
これは品質の優劣ではなく、モデル規模と対応範囲の比較です。モデルカードによると、Jev-Omniは大規模な参照モデルとの性能差を埋めることを目的としていません。
実行方法
手元のGPUで分類モデルを動かす
CUDA GPUが必要です。FP32の重みは実行時の追加メモリーを除いて約50GBあり、推論ではBF16 autocastを使います。余裕のあるメモリーを確保し、ダウンロード前にハードウェアを確認してください。
開始前に確認
重みと実行時処理に十分なメモリーを備えたCUDAマシンを用意してください。本番ワークフローに導入する前に、手元のデータで正解率、キャリブレーション、メディア処理を検証してください。
pip install -r https://huggingface.co/akhilaaa3/Jev-Omni/resolve/main/requirements.txtfrom huggingface_hub import snapshot_download
path = snapshot_download("akhilaaa3/Jev-Omni")
import sys
sys.path.insert(0, path)
from jev_omni import load_jev_omni
classifier = load_jev_omni()
result = classifier(state, question, options)画像、音声、動画では、media="/path/to/file" と modality="image"、"audio"、"video" を指定します。
事前に知っておきたい制約
トレードオフもモデルの一部
Jev-Omniは範囲の決まったマルチモーダル判断に向いています。自由形式の文章生成、長時間のメディア、選択理由の説明が必要な場合には適しません。
- 実用上は約20個まで。分類ヘッドは最大256個を受け付けますが、20個を超えた場合の品質は確認されていません。
- 短いメディアのみ。音声は最大30秒、動画は16フレームにサンプリングされます。
- 分類モデルです。出力トークンや、選択肢の理由を説明する機能はありません。
- 高性能なハードウェアが必要です。約50GBの重みとCUDA GPUを想定してください。公表速度はH200で測定されています。
- データセットの権利は重みのApache-2.0ライセンスとは別です。再配布前にモデルカードを確認してください。
JEV-OMNIとJEVの比較
理解したい入力に合わせて選ぶ
違いはシンプルです。Jev-Omniはメディア入力とセルフホスティングに対応し、Jevはホスト型の高速なテキスト判断に特化しています。
JEV-OMNIが向いている場合
判断にマルチモーダル入力が必要
- 画像、短い音声、または数秒の動画について判断したい。
- 12Bマルチモーダルモデルを動かせるCUDA GPUがあり、管理可能なオープンウェイトを使いたい。
- 公開スコアを信頼する前に、自分のデータで正解率とキャリブレーションを検証できる。
JEVが向いている場合
判断の入力がテキスト
- 多くのトリアージ、モデレーション、ルーティング、スコアリングと同様に、入力がテキストである。
- インストールやGPU保守なしで、ホスト型APIからキャリブレーション済みの確率を得たい。
- 50GBをダウンロードする前に、ブラウザーですぐに試したい。
テキストの判断は今すぐ検証できます
Jevプレイグラウンドで実際のケースを実行し、連携コードを書く前に確率分布全体を確認できます。
質問
Jev-Omniに関するFAQ
Jev-Omniとは何ですか?+
akhilaaa3が開発したオープンウェイトのマルチモーダル意思決定分類モデルです。GoogleのGemma 4 12B ITを30,000件の判断問題でファインチューニングしています。
Jev-OmniはTypeSafe製ですか?Jevと関係がありますか?+
いいえ。Jevの名称と型付き判断の考え方を取り入れた独立プロジェクトです。TypeSafeのJevは別製品のクローズドなホスト型モデルです。
Jev-OmniはJevBenchのランキングに掲載されていますか?+
直接比較できるランキング項目としては掲載されていません。モデルカードはJevBenchタスクの照合済みサブセットで86.15%を報告していますが、JevBench v1.3.0とは評価方法とランキング対象が異なります。
Jev-Omniにはどのようなハードウェアが必要ですか?+
CUDA GPUが必要です。FP32の重みは実行時の追加メモリーを除いて約50GBあり、推論ではBF16 autocastを使用します。公表速度はH200で測定されています。
Jev-Omniは選択肢をいくつ扱えますか?+
分類ヘッドは最大256個を受け付けます。モデルカードでは20個以下が最もよく検証されており、それを超える場合の品質は未確認です。
JevはJev-Omniのように画像を読めますか?+
いいえ。Jevは文字列、JSONオブジェクト、配列などのテキスト入力専用です。写真、音声メモ、動画を使った判断には、マルチモーダル版のJev-Omniを検討してください。
情報源
一次資料を読む
2026年9月22日に情報源を確認。
Jev-Omni、Gemma、およびこのページに記載されている製品は、それぞれの権利者に帰属します。数値は公開情報から引用しているため、本番環境で判断する前に確認してください。