モデル概要 · 2026年9月22日更新

Jev-Omni

テキストだけでなく、画像、音声、動画を読み取る意思決定分類モデル。

Jev-OmniはJevの型付き判断という考え方を受け継ぎ、テキスト以外にも対応します。コンテキスト、質問、選択肢を渡すと、それぞれの選択肢に対する確率を返します。

マルチモーダル判断

Jev-Omni

質問

この動画を担当者にエスカレーションすべきですか?

エスカレーション0.91
自動処理を続ける0.09

ベースモデル

Gemma 4 12B IT

パラメーター数

12B

ライセンス

Apache-2.0

作者

akhilaaa3

対応できる入力と処理速度

4つのモダリティ、1つの判断インターフェース

最適化されたバックエンドを使い、ウォーム状態のH200で20件のリクエストを実行した際の公表中央値です。前処理とネットワーク時間は別途かかり、小規模なカードでは遅くなります。

83 ms

テキスト

公表測定では約2,000トークン。

26 ms

画像

1リクエストにつき画像1枚。

31 ms

音声

最大30秒。ffmpegのインストールが必要です。

504 ms

動画

16フレームをサンプリングして処理。

これらの数値は保証値ではなく参考値として扱ってください。ウォーム状態のH200で測定され、メディアの前処理とネットワーク時間は含まれていません。

JEV-OMNIの実態

チャットモデルではなく分類モデル

Jev-Omniはakhilaaa3による独立プロジェクトで、TypeSafeのモデルではありません。GoogleのGemma 4 12B ITに分類ヘッドを追加し、30,000件の意思決定問題でファインチューニングした統合モデルです。

分類ヘッドは指定された選択肢を評価し、確率分布を返します。説明や出力トークンは生成しないため、最終的な解釈とアクションはアプリケーション側で行います。

マルチモーダル入力はGemma 4自体の機能です。初回使用時にローダーが必要なコンポーネントを取得します。重みはApache-2.0ですが、モデルカードによると学習データセットの権利は同ライセンスの対象外です。

公開された結果

背景と合わせて見る実用的な数値

モデルカードには、シナリオまたはグループごとの単純平均と、全質問を対象としたマイクロ平均の両方が記載されています。

ベンチマーク対象範囲正解率マイクロ正解率
DecisionBench Medium80シナリオ/293問87.57%86.01%
JevBench(照合済みサブセット)195グループ/231件の判断86.15%87.45%
MMAU1,000問63.10%
MVBench14タスク/2,786問53.10%53.09%
JevBenchの行を順位として解釈しないでください。これは照合済みサブセットでの86.15%です。JevBench v1.3.0では異なる測定方法とランキング対象が使われています。

規模と対応範囲

モデルカードに掲載された比較

参照スコアはモデルカードから転載しています。大規模モデルの数値は各モデルの公式発表であり、評価方法が異なる場合があると作者は説明しています。

モデルパラメーター数MMAUMVBenchモダリティ
Jev-Omni12B63.10%53.10%テキスト、画像、音声、動画
Inkling合計975B/アクティブ41B77.20%テキスト、画像、音声
Qwen3.5-397B-A17B合計397B/アクティブ17B77.60%テキスト、画像、動画

これは品質の優劣ではなく、モデル規模と対応範囲の比較です。モデルカードによると、Jev-Omniは大規模な参照モデルとの性能差を埋めることを目的としていません。

実行方法

手元のGPUで分類モデルを動かす

CUDA GPUが必要です。FP32の重みは実行時の追加メモリーを除いて約50GBあり、推論ではBF16 autocastを使います。余裕のあるメモリーを確保し、ダウンロード前にハードウェアを確認してください。

開始前に確認

重みと実行時処理に十分なメモリーを備えたCUDAマシンを用意してください。本番ワークフローに導入する前に、手元のデータで正解率、キャリブレーション、メディア処理を検証してください。

pip install -r https://huggingface.co/akhilaaa3/Jev-Omni/resolve/main/requirements.txt
from huggingface_hub import snapshot_download
path = snapshot_download("akhilaaa3/Jev-Omni")
import sys
sys.path.insert(0, path)
from jev_omni import load_jev_omni
classifier = load_jev_omni()
result = classifier(state, question, options)

画像、音声、動画では、media="/path/to/file" と modality="image"、"audio"、"video" を指定します。

事前に知っておきたい制約

トレードオフもモデルの一部

Jev-Omniは範囲の決まったマルチモーダル判断に向いています。自由形式の文章生成、長時間のメディア、選択理由の説明が必要な場合には適しません。

  • 実用上は約20個まで。分類ヘッドは最大256個を受け付けますが、20個を超えた場合の品質は確認されていません。
  • 短いメディアのみ。音声は最大30秒、動画は16フレームにサンプリングされます。
  • 分類モデルです。出力トークンや、選択肢の理由を説明する機能はありません。
  • 高性能なハードウェアが必要です。約50GBの重みとCUDA GPUを想定してください。公表速度はH200で測定されています。
  • データセットの権利は重みのApache-2.0ライセンスとは別です。再配布前にモデルカードを確認してください。

JEV-OMNIとJEVの比較

理解したい入力に合わせて選ぶ

違いはシンプルです。Jev-Omniはメディア入力とセルフホスティングに対応し、Jevはホスト型の高速なテキスト判断に特化しています。

JEV-OMNIが向いている場合

判断にマルチモーダル入力が必要

  • 画像、短い音声、または数秒の動画について判断したい。
  • 12Bマルチモーダルモデルを動かせるCUDA GPUがあり、管理可能なオープンウェイトを使いたい。
  • 公開スコアを信頼する前に、自分のデータで正解率とキャリブレーションを検証できる。

JEVが向いている場合

判断の入力がテキスト

  • 多くのトリアージ、モデレーション、ルーティング、スコアリングと同様に、入力がテキストである。
  • インストールやGPU保守なしで、ホスト型APIからキャリブレーション済みの確率を得たい。
  • 50GBをダウンロードする前に、ブラウザーですぐに試したい。

テキストの判断は今すぐ検証できます

Jevプレイグラウンドで実際のケースを実行し、連携コードを書く前に確率分布全体を確認できます。

プレイグラウンドを開く

質問

Jev-Omniに関するFAQ

Jev-Omniとは何ですか?+

akhilaaa3が開発したオープンウェイトのマルチモーダル意思決定分類モデルです。GoogleのGemma 4 12B ITを30,000件の判断問題でファインチューニングしています。

Jev-OmniはTypeSafe製ですか?Jevと関係がありますか?+

いいえ。Jevの名称と型付き判断の考え方を取り入れた独立プロジェクトです。TypeSafeのJevは別製品のクローズドなホスト型モデルです。

Jev-OmniはJevBenchのランキングに掲載されていますか?+

直接比較できるランキング項目としては掲載されていません。モデルカードはJevBenchタスクの照合済みサブセットで86.15%を報告していますが、JevBench v1.3.0とは評価方法とランキング対象が異なります。

Jev-Omniにはどのようなハードウェアが必要ですか?+

CUDA GPUが必要です。FP32の重みは実行時の追加メモリーを除いて約50GBあり、推論ではBF16 autocastを使用します。公表速度はH200で測定されています。

Jev-Omniは選択肢をいくつ扱えますか?+

分類ヘッドは最大256個を受け付けます。モデルカードでは20個以下が最もよく検証されており、それを超える場合の品質は未確認です。

JevはJev-Omniのように画像を読めますか?+

いいえ。Jevは文字列、JSONオブジェクト、配列などのテキスト入力専用です。写真、音声メモ、動画を使った判断には、マルチモーダル版のJev-Omniを検討してください。

情報源

一次資料を読む

2026年9月22日に情報源を確認。

Jev AI GitHub

Jev-Omni、Gemma、およびこのページに記載されている製品は、それぞれの権利者に帰属します。数値は公開情報から引用しているため、本番環境で判断する前に確認してください。