01 / Bewerten

Antwort-Qualitätslabor

Verwandeln Sie die Antwortqualität in eine Reihe kleiner, überprüfbarer Entscheidungen statt in eine vage Bewertung.

Antwort-Qualitätslabor
3 / Antwort + Referenzkontext
01Erdung
0.96
02Relevanz
0.88
03Vollstandigkeitserldirung
0.62
Eingetipptes Urteil geerdet · unvollständig

Das Urteil

Eine Antwort kann auf drei verschiedene Arten fehlschlagen

Halten Sie die Rubrikendimensionen getrennt, damit Ihr Team sehen kann, warum eine Antwort bestanden oder fehlgeschlagen ist.

01

Erdung

Prüfen Sie, ob Ansprüche durch den angegebenen Kontext oder die Referenzantwort unterstützt werden.

02

Relevanz

Trennen Sie eine nützliche Antwort von einer selbstbewussten Antwort, die sich von der Frage entfernt hat.

03

Vollstandigkeitserldirung

Fragen Sie, ob die Antwort die erforderlichen Punkte abdeckt, ohne alles in einem Etikett zusammenzufassen.

Eine sicherere Schleife

Bestätigen Sie den Richter, bevor Sie der Punktzahl vertrauen

Beginnen Sie mit Beispielen, bei denen die Prüfer anderer Meinung sind, messen Sie die Fehlermodi und wählen Sie erst dann einen Automatisierungsschwellenwert.

Erstellen Sie ein kleines Bewertungsset. Fügen Sie klare Pässe, klare Fehler und mehrdeutige Fälle hinzu.
Gegen Personen vergleichen. Überprüfen Sie Meinungsverschiedenheiten nach Rubrikdimensionen, anstatt sie zu mitteln.
Ungewisse Fälle weiterleiten. Senden Sie Entscheidungen mit geringem Vertrauen oder hohem Risiko an eine menschliche Bewertungswarteschlange.
Antwort + Referenzkontext

“In der Antwort wird die Richtlinie zitiert, aber das Erstattungsfenster fehlt.”

Antwort + Referenzkontext

→
Eingetipptes Urteilcase 18

Eigene Rubrik verwenden

Parallel fragen

Beweise sichtbar halten

01

Bringen Sie die Antwort

Senden Sie die generierte Antwort, Frage und Referenzmaterial als einen Zustand.

02

Benennen Sie die Schecks

Stellen Sie fokussierte Ja/Nein-, Auswahl- oder Bewertungsfragen für jede Qualitätsdimension.

03

Verbinden Sie das Ergebnis

Speichern Sie das Urteil, das Vertrauen und die Überprüfungsentscheidung neben Ihrem Bewertungslauf.

Eine Rubrik in einer Anfrage

Eine Rubrik in einer Anfrage

Beginnen Sie mit Beispielen, bei denen die Prüfer anderer Meinung sind, messen Sie die Fehlermodi und wählen Sie erst dann einen Automatisierungsschwellenwert.

Eine Rubrik in einer Anfrage
POST /v1/evaluate
{
  "state": {
    "question": "Can I get a refund?",
    "answer": "Refunds are available within 30 days.",
    "policy": "Refunds are available within 14 days."
  },
  "questions": {
    "grounded": { "type": "noul", "instructions": "Is the answer supported by policy?" },
    "complete": { "type": "score", "instructions": "How complete is the answer?", "criteria": ["missing", "partial", "complete"] }
  }
}

从建议入手

Fragen, bevor Sie bewerten

Ist das dasselbe wie einen LLM nach einer Punktzahl zu fragen?+

Der Workflow hält jedes Kriterium explizit und gibt getippte Antworten mit Wahrscheinlichkeiten zurück. Ihre Bewerbung kann entscheiden, wie Sie sie kombinieren und wann Sie eine Person einbeziehen.

Kann ich meine eigene Bewertungsrubrik verwenden?+

Ja. Die Kriterien und Antwortoptionen sind Teil der Anfrage, sodass die Rubrik mit Ihrer Produkt- oder Bewertungsrichtlinie übereinstimmen kann.

Sollte jedes Ergebnis automatisiert werden?+

Nein. Verwenden Sie repräsentative Beispiele, um Schwellenwerte festzulegen, und leiten Sie mehrdeutige oder schwerwiegende Fälle zur Überprüfung weiter.