choiceElegir una categoría
Proporciona opciones con nombres y descripciones. Obtén la opción seleccionada, la confianza y las probabilidades de cada opción.
Guía del modelo de decisiones
Clef evalúa un estado compartido según las preguntas que defines y devuelve probabilidades para las respuestas permitidas. Úsalo para asignación, clasificación y comprobaciones dentro de una aplicación.
Una guía del modelo de Cloudflare. El siguiente ejemplo se ejecuta en Workers AI con tu cuenta de Cloudflare.
Mensaje de soporte entrante
«Mi cuenta está bloqueada tras demasiados intentos de inicio de sesión. Necesito acceder antes de mi reunión».
choiceElegir el equipo responsable
scoreEvaluar la urgencia en una escala ordenada
noulEstimar si el acceso está bloqueado
Preguntas ilustrativas; aquí no se realiza inferencia en directo.
Especificaciones y precios de Workers AI comprobados el 3 de octubre de 2026. Consulta la documentación oficial para ver las actualizaciones.
01 / Cómo funciona
Clef combina un modelo base Qwen con un cabezal de esquema conjunto. Una sola pasada de propagación hacia delante puntúa las opciones válidas de todas las preguntas, sin generar una respuesta de texto intermedia.
choiceProporciona opciones con nombres y descripciones. Obtén la opción seleccionada, la confianza y las probabilidades de cada opción.
scoreProporciona criterios ordenados. La respuesta incluye una puntuación ponderada por probabilidades sobre niveles que empiezan en cero.
noulObtén la probabilidad de true. Establece el umbral de tu aplicación y decide cuándo una persona debe revisar el resultado.
02 / Clef y Clef-flash
Cloudflare presenta Clef como la opción orientada a la precisión y Clef-flash para decisiones que requieren rapidez. Evalúa ambos con ejemplos representativos de tu propio flujo de trabajo.
| Modelo | Modelo base | Mediana de latencia publicada |
|---|---|---|
| Clef | Qwen3.8-27B | 209.3 ms |
| Clef-flash | Qwen3.5-9B | 38.8 ms |
Las cifras de latencia proceden de la evaluación interna Decision Index publicada por Cloudflare. No garantizan la latencia en producción.
Leer los detalles del lanzamiento y la evaluación03 / Inicio rápido con Workers AI
Añade a tu Worker un enlace de AI llamado AI y llama a @cf/cloudflare/clef. El ejemplo evalúa tres aspectos del mismo mensaje de soporte.
Envía model, state y questions. Workers AI acepta 1–64 preguntas y devuelve las respuestas con los mismos identificadores de pregunta.
La API alojada acepta hasta cuatro imágenes PNG, JPEG o WebP incrustadas; no acepta URL de imágenes remotas. Consulta los límites del cuerpo de la solicitud en la referencia.
Clef sigue el formato tipado de solicitudes y respuestas. Al cambiar de proveedor, actualiza la autenticación y el punto de conexión, y comprueba la estructura que envuelve la respuesta del proveedor.
export default {
async fetch(request, env) {
const result = await env.AI.run("@cf/cloudflare/clef", {
model: "clef",
state: "My account is locked after too many sign-in attempts.",
questions: {
team: {
type: "choice",
instructions: "Which team should help?",
criteria: {
accounts: "Sign-in and account access",
billing: "Payments and invoices",
technical: "Service errors and outages"
}
},
urgency: {
type: "score",
instructions: "How urgently does this need attention?",
criteria: ["Low", "Medium", "High"]
},
blocked: {
type: "noul",
instructions: "Is account access blocked?"
}
}
});
return Response.json(result);
}
} satisfies ExportedHandler<{ AI: Ai }>;04 / Ejecútalo a tu manera
Usa el punto de conexión alojado de Cloudflare desde un Worker o mediante la API REST. El precio publicado de Clef se basa en los tokens de entrada.
Ver la documentación del modelo alojadoLa versión publicada en Hugging Face incluye el modelo base y el cabezal de esquema conjunto. Sigue sus ejemplos de load_release_model y systemone para alojarlo por tu cuenta, incluidas las entradas locales de imágenes y vídeo.
Leer la ficha del modeloPreguntas frecuentes
Clef devuelve decisiones limitadas a tu esquema. Usa esas respuestas para elegir la siguiente acción; utiliza un modelo de generación de texto cuando tu aplicación necesite una respuesta escrita.
No. Workers AI indica una ventana de contexto de 65,536 tokens y documenta entradas de imágenes incrustadas. La ficha del modelo local también describe entradas de vídeo, y encode_record usa 16,384 tokens de forma predeterminada. Sigue la documentación del despliegue que utilices.
Los pesos se publican bajo Apache-2.0. Revisa la licencia y los avisos incluidos si lo alojas por tu cuenta, y los términos del servicio de Cloudflare para el uso alojado.
Elige los umbrales con ejemplos etiquetados de tu flujo de trabajo. Mide las acciones incorrectas y los casos que pasan por alto, y deriva las decisiones inciertas a una alternativa o a una persona que las revise.
Fuentes oficiales