决策模型对比 · 资料核对于 2026 年 9 月 27 日

Jev vs AnyJev

两者都能返回结构化决策和概率。Jev 是开箱即用的托管模型;AnyJev 是将自行运行的开放 LLM 改造成决策系统的开源工具。

托管模型 · TypeSafe

Jev

向 API 发送状态和类型化问题,即可得到答案与概率;无需自行部署模型,也不用为每个问题拟合读出头。

开源工具 · Nokia Applied Research

AnyJev

使用开放 LLM 回答选择、是非和评分问题。L0 可以零标签起步,积累标签后再拟合校准参数或针对问题的读出头。

快速对比

实际使用有什么不同

两者能回答相近的问题,但模型运维方式和获得可信概率所需的工作不同。

维度JevAnyJev
交付方式托管生产 API基于自有开放 LLM 的 Python 工具;支持 transformers 和 vLLM 服务
输出Choice、Noul(是非)和 Score;单次请求可问多个问题选择、是非和评分决策,并返回概率分布
起步门槛无需任务专属标签,直接调用 APIL0 无需标签;会修正选项位置和标签先验偏差
概率可信度面向下游决策的校准概率L0 尚未校准;L1 用标签拟合温度参数,L2 拟合读出头
任务标签无需针对每个问题拟合读出头L1 每题约需 100–500 条;L2 每题、每模型约需 100–300 条
运维接入 API;模型基础设施由服务方托管自行运行基础模型和服务;L2 需要隐藏状态
可用形式商业托管服务项目代码采用 Apache-2.0;基础模型仍遵循各自许可

AnyJev 方法

L0、L1、L2 分别增加了什么

AnyJev 可以从零训练数据开始,但各级别对概率的保证不同。

L0

零标签

平均不同选项顺序,并修正标签先验。相较原始 logits 更稳,但不会校准不确定性。

L1

100–500 条标签

在 L0 基础上针对问题做温度校准,改善概率含义;不改变答案排序。

L2

100–300 条标签

在中间层隐藏状态上拟合闭式读出头,不改基础模型权重。读出头只适用于对应的问题和模型。

README 还介绍了原始 logits 模式。当前字母读出最多支持 26 个选项;跨度读出仍在路线图中。

公开证据

数字要放在各自的测试条件下看

AnyJev 报告称,在 Qwen3-8B 上拟合 L2 读出头后,与教师模型标签的一致率提高。这说明了方法潜力,并非 Jev 与 AnyJev 在生产环境的直接实测对比。

仓库引用了 Jev 作者在同一数据集上公布的结果,但明确说明没有自行复测 Jev。本站其他页面的 JevBench 又是另一套基准,因此不能把它们拼成统一的对战分数。

AnyJev 自报 · Qwen3-8B

64.7%

L0 准确率

77.1%

L2 准确率

LocalLLaMA/typed-decisions:20 个问题,每题 300 条标签,2,000 个留出决策。此处“准确率”指与教师 LLM 的一致率,不是独立真值。

如何选择

按自己的工作流选

需要托管 API,选 Jev

适合现在就要类型化决策与概率、希望一次请求处理多个问题,并且不想自行部署 LLM 或逐题收集标签的团队。

了解 Jev 模型

需要控制模型,选 AnyJev

适合能够自行托管开放 LLM、希望控制基础模型和部署方式,并愿意针对自己的问题验证或拟合概率的团队。

阅读 AnyJev 级别说明

Jev 与 AnyJev 常见问题

AnyJev 和 Jev 是同一个项目吗?+

不是。AnyJev 是 Nokia Applied Research 的独立开源研究项目,与 TypeSafe 和本站没有关联。

AnyJev 没有训练标签也能用吗?+

可以。L0 不需要标签,但其概率没有经过校准;L1 和 L2 需要针对各问题收集标注样本,分别用于校准或拟合读出头。

AnyJev 比 Jev 更准确吗?+

所引资料没有独立复测、条件完全一致的生产环境对比。AnyJev 公布了 Qwen 模型的结果,并引用 Jev 作者提供的 Jev 数字。若准确率是决策依据,应在自己的数据集上测两者。

资料核对于 2026 年 9 月 27 日。AnyJev 与 TypeSafe 分属各自所有者;公开数字可能随模型、数据集和部署方式改变。