02 / エージェント

エージェントの信頼性

ワークフローを自動的に続行させる前に、エージェントが言ったことだけでなく、何をしたかを検査してください。

痕跡
見直しが必要
状態を収集する合格
請求内容を確認する合格
証拠を調べます要確認
ハンドオフを選択してください保留中
各評価質問に、必要なトレースの最小スライスを与え、決定の次元を分離しておきます。

痕跡

最終的な答えは1フレームだけ

各評価質問に、必要なトレースの最小スライスを与え、決定の次元を分離しておきます。

01

タスクの完了

エージェントがそれが起こったと主張したかどうかではなく、要求された結果が実際に起こったかどうかを確認してください。

02

証拠の質

判断ツールの結果と証拠が収集された時点。

03

命令適合

成功した結果と、必要なルールに違反した結果を区別します。

故障モード

エージェントの失敗を読みやすくする

有用な評価セットは、実行のスコアリングを開始する前にエージェントが失敗する可能性がある方法に名前を付けます。

01

状態を収集する

タスク、関連するツールの呼び出し、出力、および最終状態を含めます。

02

請求内容を確認する

エージェントが要求された操作を実際に完了したかどうかを尋ねます。

03

証拠を調べます

散文だけでなく、ファイル、テスト出力、ツールの応答を使用します。

04

ハンドオフを選択してください

パス、再試行、レビュー、またはブロックを決定論的なアプリケーション ロジックにルーティングします。

マージ前にトレースを確認する

エージェントの失敗を読みやすくする

有用な評価セットは、実行のスコアリングを開始する前にエージェントが失敗する可能性がある方法に名前を付けます。

マージ前にトレースを確認する
POST /v1/agent-check
{
  "state": {
    "task": "Raise the retry limit and add tests.",
    "trace": ["edited charge.py", "ran unit tests", "no migration check"]
  },
  "questions": {
    "completed": { "type": "noul", "instructions": "Did the agent complete every requested step?" },
    "risk": { "type": "score", "instructions": "How risky is this change?", "criteria": ["low", "review", "high"] }
  }
}

よくある質問

エージェントを評価する前の質問

トレースには何を含める必要がありますか?+

タスクを含め、評価の質問に答えるために必要なツールの呼び出し、出力、および状態の変更のみを含めます。

Jev は決定的な権限を置き換えることができますか?+

いいえ。アクセス許可と不可逆的なアクションのポリシーを決定的なものにしてください。 Jev は、レビューとルーティング用に制限された信号を提供できます。

複数のディメンションを一度に評価できますか?+

はい。選択肢、スコア、および Noul の質問は、同じトレースに対して一緒に送信できます。