01
有据可依性 (Groundedness)
核查回答中的陈述是否有提供的上下文或参考答案作为支撑。
判定结果
保持评估维度的独立性,以便团队明确回答通过或未通过的具体原因。
核查回答中的陈述是否有提供的上下文或参考答案作为支撑。
区分“真正有用的回答”与“看似自信却偏离问题”的回答。
判断回答是否涵盖了所有要点,而非简单地将其归为单一标签。
更安全的评估闭环
从存在分歧的案例入手,分析失败模式,再确定自动化评估的阈值。
“回答引用了相关政策,但遗漏了退款期限信息。”
回答 + 参考上下文
使用自定义评估标准
并行评估
保留评估依据
将生成的答案、问题和参考资料作为一个“状态”整体发送。
针对每个质量维度,提出明确的“是/否”、选择题或评分题。
将判定结果、置信度和审核决定与评估运行记录一并存储。
单次请求中包含评估标准
从存在分歧的案例入手,分析失败模式,再确定自动化评估的阈值。
{
"state": {
"question": "Can I get a refund?",
"answer": "Refunds are available within 30 days.",
"policy": "Refunds are available within 14 days."
},
"questions": {
"grounded": { "type": "noul", "instructions": "Is the answer supported by policy?" },
"complete": { "type": "score", "instructions": "How complete is the answer?", "criteria": ["missing", "partial", "complete"] }
}
}常见问题
该工作流保持各项标准的独立明确,并返回带有概率的结构化答案。您的应用程序可以决定如何组合这些结果以及何时引入人工介入。
可以。标准和答案选项均包含在请求中,因此评估标准可以适配您的产品或审核策略。
不必。利用典型示例设定阈值,并将模棱两可或影响重大的案例转交人工审核。