グラウンディング性
提供されたコンテキストまたは参照回答によってクレームがサポートされているかどうかを確認します。
決定
チームが回答が合格または不合格になった理由を確認できるように、ルーブリックのディメンションを別にしておきます。
提供されたコンテキストまたは参照回答によってクレームがサポートされているかどうかを確認します。
有用な回答と、質問から逸れた自信に満ちた回答を区別してください。
すべてを 1 つのラベルにまとめることなく、回答が必要なポイントをカバーしているかどうかを尋ねます。
より安全なループ
レビュー担当者が同意しない例から始めて、障害モードを測定してから、自動化のしきい値を選択します。
“返答にはポリシーが記載されていますが、返金期間については記載されていません。”
回答 + 参照コンテキスト
独自のルーブリックを使用する
並行して質問する
証拠を目に見える状態に保つ
生成された回答、質問、参考資料を 1 つの状態として送信します。
品質のあらゆる側面について、焦点を絞った「はい/いいえ」、選択、または採点の質問をします。
評価実行の隣に、判定、信頼度、レビュー決定を保存します。
1 つのリクエストでルーブリック
レビュー担当者が同意しない例から始めて、障害モードを測定してから、自動化のしきい値を選択します。
{
"state": {
"question": "Can I get a refund?",
"answer": "Refunds are available within 30 days.",
"policy": "Refunds are available within 14 days."
},
"questions": {
"grounded": { "type": "noul", "instructions": "Is the answer supported by policy?" },
"complete": { "type": "score", "instructions": "How complete is the answer?", "criteria": ["missing", "partial", "complete"] }
}
}よくある質問
ワークフローは各基準を明示的に保ち、確率とともに入力された回答を返します。アプリケーションは、それらをどのように組み合わせるか、いつ人を関与させるかを決定できます。
はい。基準と回答オプションはリクエストの一部であるため、ルーブリックは製品またはレビュー ポリシーに一致します。
いいえ。代表的な例を使用してしきい値を設定し、曖昧なケースや影響の大きいケースをレビューにルーティングします。