01 / Evaluar

Laboratorio de calidad de respuestas

Convierte la calidad de una respuesta en decisiones pequeñas y comprobables, en lugar de una puntuación vaga.

Laboratorio de calidad de respuestas
3 / Respuesta + contexto de referencia
01Fundamentación
0.96
02Relevancia
0.88
03Integridad
0.62
Veredicto tipificado fundamentada · incompleta

La decisión

Una respuesta puede fallar de tres maneras distintas.

Mantenga separadas las dimensiones de la rúbrica para que su equipo pueda ver por qué una respuesta fue aprobada o rechazada.

01

Fundamentación

Verifique si las afirmaciones están respaldadas por el contexto suministrado o por la respuesta de referencia.

02

Relevancia

Distinga entre una respuesta útil y una respuesta dada con seguridad pero que se desvió de la pregunta.

03

Integridad

Evalúe si la respuesta abordó los puntos requeridos sin agruparlo todo bajo una única etiqueta.

Un ciclo más seguro

Valide al evaluador antes de confiar en la puntuación.

Comience con ejemplos donde los revisores discrepen, mida los tipos de fallo y, solo entonces, elija un umbral de automatización.

Cree un conjunto de evaluación reducido. Incluya casos de aprobación clara, rechazo claro y situaciones ambiguas.
Compare con evaluaciones humanas. Analice las discrepancias según la dimensión de la rúbrica en lugar de diluirlas mediante un promedio.
Gestione los casos inciertos. Envíe las decisiones de baja confianza o alto riesgo a una cola de revisión humana.
Respuesta + contexto de referencia

“La respuesta cita la política, pero omite el plazo para el reembolso.”

Respuesta + contexto de referencia

→
Veredicto tipificadocase 18

Utilice su propia rúbrica

Realice evaluaciones en paralelo

Mantenga visible la evidencia

01

Incluya la respuesta

Envíe la respuesta generada, la pregunta y el material de referencia como un único estado.

02

Asigne nombres a las comprobaciones

Plantee preguntas concretas (sí/no, de elección múltiple o de puntuación) para cada dimensión de calidad.

03

Vincule el resultado

Almacene el veredicto, el nivel de confianza y la decisión de revisión junto con la ejecución de la evaluación.

Una rúbrica en una sola solicitud

Una rúbrica en una sola solicitud

Comience con ejemplos donde los revisores discrepen, mida los tipos de fallo y, solo entonces, elija un umbral de automatización.

Una rúbrica en una sola solicitud
POST /v1/evaluate
{
  "state": {
    "question": "Can I get a refund?",
    "answer": "Refunds are available within 30 days.",
    "policy": "Refunds are available within 14 days."
  },
  "questions": {
    "grounded": { "type": "noul", "instructions": "Is the answer supported by policy?" },
    "complete": { "type": "score", "instructions": "How complete is the answer?", "criteria": ["missing", "partial", "complete"] }
  }
}

Preguntas frecuentes

Preguntas antes de evaluar

¿Es esto lo mismo que pedirle una puntuación a un LLM?+

El flujo de trabajo mantiene explícito cada criterio y devuelve respuestas tipadas con probabilidades. Tu aplicación puede decidir cómo combinarlas y cuándo requerir intervención humana.

¿Puedo usar mi propia rúbrica de evaluación?+

Sí. Los criterios y las opciones de respuesta forman parte de la solicitud, por lo que la rúbrica puede adaptarse a tu producto o política de revisión.

¿Debería automatizarse cada resultado?+

No. Utiliza ejemplos representativos para establecer umbrales y deriva los casos ambiguos o de alto impacto a revisión.