任务完成情况
检查预期的结果是否真正发生,而非仅仅依据智能体的声明。
执行轨迹
为每个评估问题提供其所需的最小轨迹片段,并保持决策维度的独立性。
检查预期的结果是否真正发生,而非仅仅依据智能体的声明。
评估工具的输出结果以及收集证据的时间点。
区分成功结果与违反强制性规则的结果。
故障模式
一个有效的评估集应在开始评分运行之前,明确列出智能体可能出现的故障类型。
包含任务、相关工具调用、输出内容及最终状态。
确认智能体是否确实执行了所要求的操作。
利用文件、测试输出和工具响应,而不仅仅是文本描述。
将“通过”、“重试”、“人工审核”或“拦截”等结果纳入确定性的应用程序逻辑中。
合并前检查执行轨迹
一个有效的评估集应在开始评分运行之前,明确列出智能体可能出现的故障类型。
{
"state": {
"task": "Raise the retry limit and add tests.",
"trace": ["edited charge.py", "ran unit tests", "no migration check"]
},
"questions": {
"completed": { "type": "noul", "instructions": "Did the agent complete every requested step?" },
"risk": { "type": "score", "instructions": "How risky is this change?", "criteria": ["low", "review", "high"] }
}
}常见问题
包含任务本身,以及回答评估问题所需的工具调用、输出和状态变更信息。
不能。权限和不可逆操作策略应保持确定性。Jev 可提供用于审核和路由的参考信号。
可以。针对同一执行轨迹,可以同时提交“选择题”、“评分题”和“Noul(是/否/未知)”类问题。