它能读取什么,以及有多快
四种模态,一个决策接口
数据来自优化后端上 H200 预热状态下 20 次请求的中位数。这里不包含预处理和网络时间;更小的显卡会更慢。
文本
公开测量约 2,000 个 token。
图片
每次请求一张图片。
音频
上限 30 秒,需要安装 ffmpeg。
视频
采样为 16 帧。
把这些数字当作参考,而不是承诺:它们来自预热的 H200,也不包含媒体预处理和网络时间。
JEV-OMNI 到底是什么
它是分类器,不是聊天模型
Jev-Omni 是 akhilaaa3 的独立工作,并非 TypeSafe 的模型。它基于 Google Gemma 4 12B IT 加上分类头,在 30,000 个决策问题上微调,并以合并模型形式发布。
分类头会对你提供的选项打分并返回概率分布。它不会生成解释,也不会输出连续 token,因此最终如何解释结果、执行什么动作,仍由你的应用负责。
多模态输入能力来自 Gemma 4 本身,首次使用时加载器会自动拉取所需组件。权重使用 Apache-2.0;模型卡也单独说明,训练数据集的权利不包含在这个许可证中。
公开结果
把数字和上下文一起看
模型卡同时报告了场景或分组的等权平均,以及所有问题的 micro average。
| 基准 | 范围 | 准确率 | Micro 准确率 |
|---|---|---|---|
| DecisionBench Medium | 80 个场景 / 293 个问题 | 87.57% | 86.01% |
| JevBench(匹配子集) | 195 组 / 231 个决策 | 86.15% | 87.45% |
| MMAU | 1,000 个问题 | — | 63.10% |
| MVBench | 14 个任务 / 2,786 个问题 | 53.10% | 53.09% |
规模与覆盖范围
模型卡如何进行对比
以下参考分数来自模型卡。作者说明,更大的模型使用各自开发者公开的官方数字,评测协议可能并不相同。
| 模型 | 参数量 | MMAU | MVBench | 模态 |
|---|---|---|---|---|
| Jev-Omni | 12B | 63.10% | 53.10% | 文本、图片、音频、视频 |
| Inkling | 总计 975B / 激活 41B | 77.20% | — | 文本、图片、音频 |
| Qwen3.5-397B-A17B | 总计 397B / 激活 17B | — | 77.60% | 文本、图片、视频 |
诚实地说,这是一张规模与覆盖范围对比表,而不是质量结论。Jev-Omni 的公开分数低于更大的参考模型,但参数量只有它们的一小部分,并且在这里是唯一覆盖四种模态的模型。
运行方式
在自己的 GPU 上运行分类器
需要 CUDA GPU。FP32 权重在运行时开销之前约 50 GB;推理使用 BF16 autocast。处理音频还需要 ffmpeg。
开始之前
准备一台有足够显存容纳权重和运行时的 CUDA 机器。把结果放进关键链路前,先用自己的数据验证准确率、校准度和媒体预处理流程。
pip install -r https://huggingface.co/akhilaaa3/Jev-Omni/resolve/main/requirements.txtfrom huggingface_hub import snapshot_download
path = snapshot_download("akhilaaa3/Jev-Omni")
import sys
sys.path.insert(0, path)
from jev_omni import load_jev_omni
classifier = load_jev_omni()
result = classifier(state, question, options)处理图片、音频或视频时,加入 media="/path/to/file",并将 modality 设置为 "image"、"audio" 或 "video"。
需要先知道的限制
这些取舍就是模型的一部分
当决策有明确边界且涉及多模态输入时,Jev-Omni 很有价值;但如果你需要开放式生成、长媒体或轻量托管接口,它就不一定合适。
- 实际使用建议不超过 20 个选项。分类头最多接受 256 个,但超过 20 个后的质量尚未得到验证。
- 媒体时长较短。音频上限 30 秒,视频采样为 16 帧。
- 它是分类器,不会生成输出 token,也不会解释为什么选择了某个选项。
- 硬件要求较高。权重约 50 GB,需要 CUDA GPU;公开速度来自 H200 测量。
- 数据集权利与权重的 Apache-2.0 许可证是两回事。重新分发前请查看模型卡。
JEV-OMNI 还是 JEV?
根据你需要理解的状态来选择
边界很简单:Jev-Omni 增加了媒体输入和自托管能力;Jev 专注于快速、托管的文本决策。
适合选择 JEV-OMNI 的情况
决策涉及多模态输入
- 决策对象是一张图片、一段短语音,或几秒钟的视频。
- 你有足够运行 12B 多模态模型的 CUDA GPU,并希望掌控开源权重。
- 你愿意先用自己的数据验证准确率和校准度,再相信公开数字。
适合选择 JEV 的情况
决策对象是文本
- 状态是文本,覆盖大多数分流、审核、路由和评分工作。
- 你希望使用托管 API 获取校准后的概率,不安装模型,也不维护 GPU。
- 你想在一分钟内从浏览器开始,而不是先下载 50 GB 权重。
文本决策现在就能测试
在 Jev Playground 中运行一个真实案例,先查看完整概率分布,再开始写接入代码。
常见问题
Jev-Omni FAQ
Jev-Omni 是什么?+
它是 akhilaaa3 开发的开源权重多模态决策分类器,基于 Google Gemma 4 12B IT,在 30,000 个决策问题上微调。给它状态、问题和选项后,它会返回概率。
Jev-Omni 是 TypeSafe 制作的吗?或者和 Jev 有关系吗?+
不是。它是独立项目,只是借用了 Jev 这个名字和类型化决策思路。TypeSafe 的 Jev 是闭源托管模型;Jev-Omni 是基于 Gemma 4 的 Apache-2.0 权重,需要自行运行。
Jev-Omni 出现在 JevBench 排名中吗?+
不能直接当作排名条目比较。模型卡报告的是 JevBench 匹配子集上的 86.15%,而 JevBench v1.3.0 是覆盖更广泛系统的另一套测量。
Jev-Omni 需要什么硬件?+
需要 CUDA GPU。FP32 权重在运行时开销之前约 50 GB,推理采用 BF16 autocast。公开延迟来自预热 H200,因此应把它当作上限参考,而不是保证。
Jev-Omni 能处理多少个选项?+
分类头最多接受 256 个,但模型卡表示最好控制在 20 个以内,超过 20 个后的质量尚未得到验证。正式依赖前,请在自己的选项数量上测试。
Jev 能像 Jev-Omni 一样读取图片吗?+
不能。Jev 只处理文本:字符串、JSON 对象或文本数组。如果决策对象是照片、语音或视频片段,应使用 Jev-Omni 这样的多模态模型。
来源
阅读一手资料
来源核对日期:2026 年 9 月 22 日。
本页提及的 Jev-Omni、Gemma 和其他产品均属于各自所有者。数字来自链接中的公开资料,仅供了解和比较,不构成性能保证。