决策模型对比 · 资料核对于 2026 年 9 月 27 日
Jev vs AnyJev
两者都能返回结构化决策和概率。Jev 是开箱即用的托管模型;AnyJev 是将自行运行的开放 LLM 改造成决策系统的开源工具。
托管模型 · TypeSafe
Jev
向 API 发送状态和类型化问题,即可得到答案与概率;无需自行部署模型,也不用为每个问题拟合读出头。
开源工具 · Nokia Applied Research
AnyJev
使用开放 LLM 回答选择、是非和评分问题。L0 可以零标签起步,积累标签后再拟合校准参数或针对问题的读出头。
快速对比
实际使用有什么不同
两者能回答相近的问题,但模型运维方式和获得可信概率所需的工作不同。
| 维度 | Jev | AnyJev |
|---|---|---|
| 交付方式 | 托管生产 API | 基于自有开放 LLM 的 Python 工具;支持 transformers 和 vLLM 服务 |
| 输出 | Choice、Noul(是非)和 Score;单次请求可问多个问题 | 选择、是非和评分决策,并返回概率分布 |
| 起步门槛 | 无需任务专属标签,直接调用 API | L0 无需标签;会修正选项位置和标签先验偏差 |
| 概率可信度 | 面向下游决策的校准概率 | L0 尚未校准;L1 用标签拟合温度参数,L2 拟合读出头 |
| 任务标签 | 无需针对每个问题拟合读出头 | L1 每题约需 100–500 条;L2 每题、每模型约需 100–300 条 |
| 运维 | 接入 API;模型基础设施由服务方托管 | 自行运行基础模型和服务;L2 需要隐藏状态 |
| 可用形式 | 商业托管服务 | 项目代码采用 Apache-2.0;基础模型仍遵循各自许可 |
AnyJev 方法
L0、L1、L2 分别增加了什么
AnyJev 可以从零训练数据开始,但各级别对概率的保证不同。
L0
零标签平均不同选项顺序,并修正标签先验。相较原始 logits 更稳,但不会校准不确定性。
L1
100–500 条标签在 L0 基础上针对问题做温度校准,改善概率含义;不改变答案排序。
L2
100–300 条标签在中间层隐藏状态上拟合闭式读出头,不改基础模型权重。读出头只适用于对应的问题和模型。
README 还介绍了原始 logits 模式。当前字母读出最多支持 26 个选项;跨度读出仍在路线图中。
公开证据
数字要放在各自的测试条件下看
AnyJev 报告称,在 Qwen3-8B 上拟合 L2 读出头后,与教师模型标签的一致率提高。这说明了方法潜力,并非 Jev 与 AnyJev 在生产环境的直接实测对比。
仓库引用了 Jev 作者在同一数据集上公布的结果,但明确说明没有自行复测 Jev。本站其他页面的 JevBench 又是另一套基准,因此不能把它们拼成统一的对战分数。
AnyJev 自报 · Qwen3-8B
64.7%
L0 准确率
77.1%
L2 准确率
LocalLLaMA/typed-decisions:20 个问题,每题 300 条标签,2,000 个留出决策。此处“准确率”指与教师 LLM 的一致率,不是独立真值。
如何选择
按自己的工作流选
Jev 与 AnyJev 常见问题
AnyJev 和 Jev 是同一个项目吗?+
不是。AnyJev 是 Nokia Applied Research 的独立开源研究项目,与 TypeSafe 和本站没有关联。
AnyJev 没有训练标签也能用吗?+
可以。L0 不需要标签,但其概率没有经过校准;L1 和 L2 需要针对各问题收集标注样本,分别用于校准或拟合读出头。
AnyJev 比 Jev 更准确吗?+
所引资料没有独立复测、条件完全一致的生产环境对比。AnyJev 公布了 Qwen 模型的结果,并引用 Jev 作者提供的 Jev 数字。若准确率是决策依据,应在自己的数据集上测两者。
资料核对于 2026 年 9 月 27 日。AnyJev 与 TypeSafe 分属各自所有者;公开数字可能随模型、数据集和部署方式改变。
