实用对比 · JevBench v1.3.0 · 更新于 2026 年 9 月 22 日

Jev vs OpenJev

两个决策系统,共享一种兼容思路。下面看看托管版 Jev 与开源 OpenJev 真正差在哪里。

本站提供

Jev 1.13.0

TypeSafe · System One 模型

74.4

JevBench 综合得分 · 第 1 名

本 Playground 背后的托管决策模型。

对比

开源项目

OpenJev

razorback16 / Codiv · DiffusionGemma 26B-A4B

66.4

JevBench 综合得分 · 第 11 名

可以自行部署,也可以通过 Codiv 运行的 Jev 兼容决策服务。

运行位置

托管生产 API

自行部署在 24GB GPU 或 Apple Silicon 上

请求格式

原生 /v1/systemone

兼容 TypeSafe SDK 的协议

输入

仅文本

文本,单次最多 8 张图片

单个选择的选项数

最多 255 个

最多 128 个

置信度

经过校准的概率

由熵推导的置信度

思考模式

不提供

提供,但会在质量和延迟之间取舍

本文中的 OpenJev 特指 razorback16 基于 DiffusionGemma 的项目,并不是所有曾经使用过这个名字的项目。

使用同一套方法测量

基准测试比单一分数更能说明问题

JevBench v1.3.0 用同一套决策集测试了两个系统。默认配置下 Jev 更均衡;开启思考模式后,OpenJev 在困难案例上会更强。

综合得分

由智能、校准、速度和成本四项指标的几何平均得出。

Jev

74.4

/

OpenJev

66.4

在这份公开对比中,Jev 排名第 1,OpenJev 排名第 11。

能力维度

越高越好

智能

选对答案的频率

85.7 / 79.2

校准

0.8 是否大约意味着 80%

82.7 / 64.8

速度

实际测得的响应速度

83.3 / 83.2

不同难度下的准确率

JevOpenJev

简单

72 个直接判断案例

100%100%

标准

96 个日常判断案例

99%95.8%

评审

146 个评估式调用

94.5%91.1%

困难

220 个真正有歧义的案例

74.1%65.5%

在思考模式下,OpenJev 报告的智能得分为 88.0,困难案例准确率为 78.2%。这属于另一种运行配置,不应与默认配置直接等量齐观。

数据来自参考页面及其公开来源;在做生产决策前,请用自己的任务集重新验证。

逐项对比

请求形状相同,运行方式不同

OpenJev 有意兼容 Jev 的协议。请求离开你的代码之后,才是两者差异真正开始的地方。

属性Jev 1.13.0OpenJev
它是什么TypeSafe 提供的托管 System One 模型运行在 DiffusionGemma 26B-A4B-it 上的自托管决策服务
许可证专有、托管Apache-2.0;权重来自 NVIDIA 与 Google
请求格式POST /v1/systemone相同格式;接受 openjev-latest 与 jev-latest
问题类型Noul、choice、score,可并行询问多个问题Noul、最多 128 个选项的 choice,以及 2–10 个等级的 score
输入文本、JSON 对象或数组文本,每次请求最多 8 张图片
超出 schema 的答案只返回类型化答案结构上不可能发生,因为模型读取的是答案槽位
不确定性处理每个答案都有经过校准的概率熵较高时最多重新读取四次,再取平均值
硬件无需硬件,只需调用 APIvLLM 需要 24GB NVIDIA GPU,MLX 需要 16GB 可用 Apple Silicon 内存
运行成本按 Jev AI credits 计费租用 GPU 时约每 1,000 次决策 0.066 美元,Codiv 托管可免费使用

取舍

各自更适合什么

没有适合所有场景的赢家。选择取决于你更看重托管接入、可校准的置信度、图片输入,还是对运行环境的控制权。

选择 Jev,如果你需要

  • 不必自己拟合校准层,就能使用有实际含义的置信度。
  • 在排名配置下更高的困难案例准确率:74.1% 对 65.5%。
  • 单个 choice 最多 255 个选项,不需要运维 GPU、vLLM 或量化模型权重。
  • 一个稳定的托管配置,方便固定版本并接入生产逻辑。
  • 从实验快速走到真正 API 请求的路径。

选择 OpenJev,如果你需要

  • 真正兼容 TypeSafe SDK:只需要修改 base URL,请求结构可以保持不变。
  • 支持图片输入,单个决策请求最多 8 张图片。
  • 提供思考模式,在困难案例上可以超过默认配置。
  • 结构化的答案路径,模型不会直接写入答案槽位。
  • 代码与权重采用 Apache-2.0,可部署在内网或 Apple Silicon 上。

来自仓库的信息

razorback16 的 OpenJev 实际包含什么

OpenJev 不只是一个模型权重,而是围绕 DiffusionGemma 构建的小型决策服务,同时提供 vLLM 与 MLX 后端。

打开 GitHub 仓库

兼容 API

POST /v1/systemone,同时提供 OpenAI 风格的 /v1/chat/completions

后端

NVIDIA GPU 使用 vLLM;Apple Silicon 使用 MLX

部署

支持 Docker 或本地 Python 进程;Codiv 提供免费托管访问

许可证

Apache-2.0

OpenJev 是独立项目,与 TypeSafe AI 没有隶属或背书关系。

所以该选哪个?

先从最重要的约束开始

选择与你的部署边界,以及产品需要处理的不确定性相匹配的决策模型。

1

选择 Jev,如果你:

  • 需要直接根据概率做分支,并希望它开箱即用就有意义。
  • 不想运维 26B 扩散模型,也不想调节去噪步数。
  • 输入主要是文本,并且希望使用一个稳定的托管配置。
2

选择 OpenJev,如果你:

  • 决策涉及图片,或需要给困难案例分配思考预算。
  • 已经运行 GPU,或者数据必须留在自己的网络内。
  • 愿意用自己的标注数据验证置信度阈值。

最快的答案来自你自己的测试集

在真正争论的案例上试试 Jev

在 Playground 中跑几个边界案例,再与符合你硬件条件的 OpenJev 配置进行比较。

常见问题

关于 Jev vs OpenJev 的问题

可以把 TypeSafe SDK 指向 OpenJev 吗?+

可以,razorback16 的服务支持 /v1/systemone 协议,也接受 Jev 兼容的模型别名,主要集成步骤就是修改 base URL。

OpenJev 和 Jev 一样准确吗?+

在排名配置下,OpenJev 在困难案例和校准指标上落后于 Jev。它的思考模式是另一种配置,公开结果显示该模式在困难案例上拥有更高的智能得分。

OpenJev 需要什么硬件?+

仓库文档说明,NVIDIA 方案大约需要 24GB 显存;Apple Silicon 方案需要约 16GB 可用内存来运行 4-bit MLX 权重。Codiv 也提供托管访问。

OpenJev 能替代 Jev 吗?+

对于图片输入、自托管或 Apache-2.0 许可很重要的场景,它可以替代端点。但它不等同于托管 API 在运维层面的保证。

本文提到的 OpenJev 及其他项目均属于各自所有者。数据来自截至 2026 年 9 月 22 日核对的公开来源。