タスクの完了
エージェントがそれが起こったと主張したかどうかではなく、要求された結果が実際に起こったかどうかを確認してください。
ワークフローを自動的に続行させる前に、エージェントが言ったことだけでなく、何をしたかを検査してください。
痕跡
各評価質問に、必要なトレースの最小スライスを与え、決定の次元を分離しておきます。
エージェントがそれが起こったと主張したかどうかではなく、要求された結果が実際に起こったかどうかを確認してください。
判断ツールの結果と証拠が収集された時点。
成功した結果と、必要なルールに違反した結果を区別します。
故障モード
有用な評価セットは、実行のスコアリングを開始する前にエージェントが失敗する可能性がある方法に名前を付けます。
タスク、関連するツールの呼び出し、出力、および最終状態を含めます。
エージェントが要求された操作を実際に完了したかどうかを尋ねます。
散文だけでなく、ファイル、テスト出力、ツールの応答を使用します。
パス、再試行、レビュー、またはブロックを決定論的なアプリケーション ロジックにルーティングします。
マージ前にトレースを確認する
有用な評価セットは、実行のスコアリングを開始する前にエージェントが失敗する可能性がある方法に名前を付けます。
{
"state": {
"task": "Raise the retry limit and add tests.",
"trace": ["edited charge.py", "ran unit tests", "no migration check"]
},
"questions": {
"completed": { "type": "noul", "instructions": "Did the agent complete every requested step?" },
"risk": { "type": "score", "instructions": "How risky is this change?", "criteria": ["low", "review", "high"] }
}
}よくある質問
タスクを含め、評価の質問に答えるために必要なツールの呼び出し、出力、および状態の変更のみを含めます。
いいえ。アクセス許可と不可逆的なアクションのポリシーを決定的なものにしてください。 Jev は、レビューとルーティング用に制限された信号を提供できます。
はい。選択肢、スコア、および Noul の質問は、同じトレースに対して一緒に送信できます。