实用对比 · JevBench v1.3.0 · 更新于 2026 年 9 月 22 日
Jev vs OpenJev
两个决策系统,共享一种兼容思路。下面看看托管版 Jev 与开源 OpenJev 真正差在哪里。
本站提供
Jev 1.13.0
TypeSafe · System One 模型
74.4
JevBench 综合得分 · 第 1 名
本 Playground 背后的托管决策模型。
开源项目
OpenJev
razorback16 / Codiv · DiffusionGemma 26B-A4B
66.4
JevBench 综合得分 · 第 11 名
可以自行部署,也可以通过 Codiv 运行的 Jev 兼容决策服务。
运行位置
托管生产 API
自行部署在 24GB GPU 或 Apple Silicon 上
请求格式
原生 /v1/systemone
兼容 TypeSafe SDK 的协议
输入
仅文本
文本,单次最多 8 张图片
单个选择的选项数
最多 255 个
最多 128 个
置信度
经过校准的概率
由熵推导的置信度
思考模式
不提供
提供,但会在质量和延迟之间取舍
本文中的 OpenJev 特指 razorback16 基于 DiffusionGemma 的项目,并不是所有曾经使用过这个名字的项目。
使用同一套方法测量
基准测试比单一分数更能说明问题
JevBench v1.3.0 用同一套决策集测试了两个系统。默认配置下 Jev 更均衡;开启思考模式后,OpenJev 在困难案例上会更强。
综合得分
由智能、校准、速度和成本四项指标的几何平均得出。
Jev
74.4
OpenJev
66.4
在这份公开对比中,Jev 排名第 1,OpenJev 排名第 11。
能力维度
越高越好
智能
选对答案的频率
85.7 / 79.2
校准
0.8 是否大约意味着 80%
82.7 / 64.8
速度
实际测得的响应速度
83.3 / 83.2
不同难度下的准确率
简单
72 个直接判断案例
标准
96 个日常判断案例
评审
146 个评估式调用
困难
220 个真正有歧义的案例
在思考模式下,OpenJev 报告的智能得分为 88.0,困难案例准确率为 78.2%。这属于另一种运行配置,不应与默认配置直接等量齐观。
数据来自参考页面及其公开来源;在做生产决策前,请用自己的任务集重新验证。
逐项对比
请求形状相同,运行方式不同
OpenJev 有意兼容 Jev 的协议。请求离开你的代码之后,才是两者差异真正开始的地方。
| 属性 | Jev 1.13.0 | OpenJev |
|---|---|---|
| 它是什么 | TypeSafe 提供的托管 System One 模型 | 运行在 DiffusionGemma 26B-A4B-it 上的自托管决策服务 |
| 许可证 | 专有、托管 | Apache-2.0;权重来自 NVIDIA 与 Google |
| 请求格式 | POST /v1/systemone | 相同格式;接受 openjev-latest 与 jev-latest |
| 问题类型 | Noul、choice、score,可并行询问多个问题 | Noul、最多 128 个选项的 choice,以及 2–10 个等级的 score |
| 输入 | 文本、JSON 对象或数组 | 文本,每次请求最多 8 张图片 |
| 超出 schema 的答案 | 只返回类型化答案 | 结构上不可能发生,因为模型读取的是答案槽位 |
| 不确定性处理 | 每个答案都有经过校准的概率 | 熵较高时最多重新读取四次,再取平均值 |
| 硬件 | 无需硬件,只需调用 API | vLLM 需要 24GB NVIDIA GPU,MLX 需要 16GB 可用 Apple Silicon 内存 |
| 运行成本 | 按 Jev AI credits 计费 | 租用 GPU 时约每 1,000 次决策 0.066 美元,Codiv 托管可免费使用 |
取舍
各自更适合什么
没有适合所有场景的赢家。选择取决于你更看重托管接入、可校准的置信度、图片输入,还是对运行环境的控制权。
选择 Jev,如果你需要
- 不必自己拟合校准层,就能使用有实际含义的置信度。
- 在排名配置下更高的困难案例准确率:74.1% 对 65.5%。
- 单个 choice 最多 255 个选项,不需要运维 GPU、vLLM 或量化模型权重。
- 一个稳定的托管配置,方便固定版本并接入生产逻辑。
- 从实验快速走到真正 API 请求的路径。
选择 OpenJev,如果你需要
- 真正兼容 TypeSafe SDK:只需要修改 base URL,请求结构可以保持不变。
- 支持图片输入,单个决策请求最多 8 张图片。
- 提供思考模式,在困难案例上可以超过默认配置。
- 结构化的答案路径,模型不会直接写入答案槽位。
- 代码与权重采用 Apache-2.0,可部署在内网或 Apple Silicon 上。
来自仓库的信息
razorback16 的 OpenJev 实际包含什么
OpenJev 不只是一个模型权重,而是围绕 DiffusionGemma 构建的小型决策服务,同时提供 vLLM 与 MLX 后端。
打开 GitHub 仓库兼容 API
POST /v1/systemone,同时提供 OpenAI 风格的 /v1/chat/completions
后端
NVIDIA GPU 使用 vLLM;Apple Silicon 使用 MLX
部署
支持 Docker 或本地 Python 进程;Codiv 提供免费托管访问
许可证
Apache-2.0
OpenJev 是独立项目,与 TypeSafe AI 没有隶属或背书关系。
所以该选哪个?
先从最重要的约束开始
选择与你的部署边界,以及产品需要处理的不确定性相匹配的决策模型。
选择 Jev,如果你:
- 需要直接根据概率做分支,并希望它开箱即用就有意义。
- 不想运维 26B 扩散模型,也不想调节去噪步数。
- 输入主要是文本,并且希望使用一个稳定的托管配置。
选择 OpenJev,如果你:
- 决策涉及图片,或需要给困难案例分配思考预算。
- 已经运行 GPU,或者数据必须留在自己的网络内。
- 愿意用自己的标注数据验证置信度阈值。
最快的答案来自你自己的测试集
在真正争论的案例上试试 Jev
在 Playground 中跑几个边界案例,再与符合你硬件条件的 OpenJev 配置进行比较。
常见问题
关于 Jev vs OpenJev 的问题
可以把 TypeSafe SDK 指向 OpenJev 吗?+
可以,razorback16 的服务支持 /v1/systemone 协议,也接受 Jev 兼容的模型别名,主要集成步骤就是修改 base URL。
OpenJev 和 Jev 一样准确吗?+
在排名配置下,OpenJev 在困难案例和校准指标上落后于 Jev。它的思考模式是另一种配置,公开结果显示该模式在困难案例上拥有更高的智能得分。
OpenJev 需要什么硬件?+
仓库文档说明,NVIDIA 方案大约需要 24GB 显存;Apple Silicon 方案需要约 16GB 可用内存来运行 4-bit MLX 权重。Codiv 也提供托管访问。
OpenJev 能替代 Jev 吗?+
对于图片输入、自托管或 Apache-2.0 许可很重要的场景,它可以替代端点。但它不等同于托管 API 在运维层面的保证。
本文提到的 OpenJev 及其他项目均属于各自所有者。数据来自截至 2026 年 9 月 22 日核对的公开来源。