模型档案 · 2026 年 9 月 22 日更新

Jev-Omni

一个能读取图片、声音和视频,而不只是文本的决策分类器。

Jev-Omni 借鉴 Jev 的类型化决策思路,并将输入扩展到文本之外。给它一份状态、一个问题和一组选项,它会返回每个选项的概率。

多模态决策

Jev-Omni

问题

这段视频是否需要升级给人工处理?

升级处理0.91
继续自动处理0.09

基础模型

Gemma 4 12B IT

参数量

12B

许可证

Apache-2.0

作者

akhilaaa3

它能读取什么,以及有多快

四种模态,一个决策接口

数据来自优化后端上 H200 预热状态下 20 次请求的中位数。这里不包含预处理和网络时间;更小的显卡会更慢。

83 ms

文本

公开测量约 2,000 个 token。

26 ms

图片

每次请求一张图片。

31 ms

音频

上限 30 秒,需要安装 ffmpeg。

504 ms

视频

采样为 16 帧。

把这些数字当作参考,而不是承诺:它们来自预热的 H200,也不包含媒体预处理和网络时间。

JEV-OMNI 到底是什么

它是分类器,不是聊天模型

Jev-Omni 是 akhilaaa3 的独立工作,并非 TypeSafe 的模型。它基于 Google Gemma 4 12B IT 加上分类头,在 30,000 个决策问题上微调,并以合并模型形式发布。

分类头会对你提供的选项打分并返回概率分布。它不会生成解释,也不会输出连续 token,因此最终如何解释结果、执行什么动作,仍由你的应用负责。

多模态输入能力来自 Gemma 4 本身,首次使用时加载器会自动拉取所需组件。权重使用 Apache-2.0;模型卡也单独说明,训练数据集的权利不包含在这个许可证中。

公开结果

把数字和上下文一起看

模型卡同时报告了场景或分组的等权平均,以及所有问题的 micro average。

基准范围准确率Micro 准确率
DecisionBench Medium80 个场景 / 293 个问题87.57%86.01%
JevBench(匹配子集)195 组 / 231 个决策86.15%87.45%
MMAU1,000 个问题63.10%
MVBench14 个任务 / 2,786 个问题53.10%53.09%
不要把 JevBench 这一行理解成排行榜名次。它是匹配子集上的 86.15% 结果,而 JevBench v1.3.0 使用的是另一套测量和排名样本。

规模与覆盖范围

模型卡如何进行对比

以下参考分数来自模型卡。作者说明,更大的模型使用各自开发者公开的官方数字,评测协议可能并不相同。

模型参数量MMAUMVBench模态
Jev-Omni12B63.10%53.10%文本、图片、音频、视频
Inkling总计 975B / 激活 41B77.20%文本、图片、音频
Qwen3.5-397B-A17B总计 397B / 激活 17B77.60%文本、图片、视频

诚实地说,这是一张规模与覆盖范围对比表,而不是质量结论。Jev-Omni 的公开分数低于更大的参考模型,但参数量只有它们的一小部分,并且在这里是唯一覆盖四种模态的模型。

运行方式

在自己的 GPU 上运行分类器

需要 CUDA GPU。FP32 权重在运行时开销之前约 50 GB;推理使用 BF16 autocast。处理音频还需要 ffmpeg。

开始之前

准备一台有足够显存容纳权重和运行时的 CUDA 机器。把结果放进关键链路前,先用自己的数据验证准确率、校准度和媒体预处理流程。

pip install -r https://huggingface.co/akhilaaa3/Jev-Omni/resolve/main/requirements.txt
from huggingface_hub import snapshot_download
path = snapshot_download("akhilaaa3/Jev-Omni")
import sys
sys.path.insert(0, path)
from jev_omni import load_jev_omni
classifier = load_jev_omni()
result = classifier(state, question, options)

处理图片、音频或视频时,加入 media="/path/to/file",并将 modality 设置为 "image"、"audio" 或 "video"。

需要先知道的限制

这些取舍就是模型的一部分

当决策有明确边界且涉及多模态输入时,Jev-Omni 很有价值;但如果你需要开放式生成、长媒体或轻量托管接口,它就不一定合适。

  • 实际使用建议不超过 20 个选项。分类头最多接受 256 个,但超过 20 个后的质量尚未得到验证。
  • 媒体时长较短。音频上限 30 秒,视频采样为 16 帧。
  • 它是分类器,不会生成输出 token,也不会解释为什么选择了某个选项。
  • 硬件要求较高。权重约 50 GB,需要 CUDA GPU;公开速度来自 H200 测量。
  • 数据集权利与权重的 Apache-2.0 许可证是两回事。重新分发前请查看模型卡。

JEV-OMNI 还是 JEV?

根据你需要理解的状态来选择

边界很简单:Jev-Omni 增加了媒体输入和自托管能力;Jev 专注于快速、托管的文本决策。

适合选择 JEV-OMNI 的情况

决策涉及多模态输入

  • 决策对象是一张图片、一段短语音,或几秒钟的视频。
  • 你有足够运行 12B 多模态模型的 CUDA GPU,并希望掌控开源权重。
  • 你愿意先用自己的数据验证准确率和校准度,再相信公开数字。

适合选择 JEV 的情况

决策对象是文本

  • 状态是文本,覆盖大多数分流、审核、路由和评分工作。
  • 你希望使用托管 API 获取校准后的概率,不安装模型,也不维护 GPU。
  • 你想在一分钟内从浏览器开始,而不是先下载 50 GB 权重。

文本决策现在就能测试

在 Jev Playground 中运行一个真实案例,先查看完整概率分布,再开始写接入代码。

打开 Playground

常见问题

Jev-Omni FAQ

Jev-Omni 是什么?+

它是 akhilaaa3 开发的开源权重多模态决策分类器,基于 Google Gemma 4 12B IT,在 30,000 个决策问题上微调。给它状态、问题和选项后,它会返回概率。

Jev-Omni 是 TypeSafe 制作的吗?或者和 Jev 有关系吗?+

不是。它是独立项目,只是借用了 Jev 这个名字和类型化决策思路。TypeSafe 的 Jev 是闭源托管模型;Jev-Omni 是基于 Gemma 4 的 Apache-2.0 权重,需要自行运行。

Jev-Omni 出现在 JevBench 排名中吗?+

不能直接当作排名条目比较。模型卡报告的是 JevBench 匹配子集上的 86.15%,而 JevBench v1.3.0 是覆盖更广泛系统的另一套测量。

Jev-Omni 需要什么硬件?+

需要 CUDA GPU。FP32 权重在运行时开销之前约 50 GB,推理采用 BF16 autocast。公开延迟来自预热 H200,因此应把它当作上限参考,而不是保证。

Jev-Omni 能处理多少个选项?+

分类头最多接受 256 个,但模型卡表示最好控制在 20 个以内,超过 20 个后的质量尚未得到验证。正式依赖前,请在自己的选项数量上测试。

Jev 能像 Jev-Omni 一样读取图片吗?+

不能。Jev 只处理文本:字符串、JSON 对象或文本数组。如果决策对象是照片、语音或视频片段,应使用 Jev-Omni 这样的多模态模型。

来源

阅读一手资料

来源核对日期:2026 年 9 月 22 日。

Jev AI GitHub

本页提及的 Jev-Omni、Gemma 和其他产品均属于各自所有者。数字来自链接中的公开资料,仅供了解和比较,不构成性能保证。