Leitfaden für Entscheidungsmodelle

Cloudflare Clef. Kontext hinein, Entscheidungen heraus.

Clef wertet einen gemeinsamen Zustand anhand Ihrer Fragen aus und liefert Wahrscheinlichkeiten für die zulässigen Antworten. Nutzen Sie es für Routing, Klassifizierung und Prüfungen innerhalb einer Anwendung.

Ein Leitfaden zum Modell von Cloudflare. Das folgende Beispiel wird mit Ihrem Cloudflare-Konto auf Workers AI ausgeführt.

Ein Zustand, drei Entscheidungen

Eingehende Supportnachricht

„Mein Konto wurde nach zu vielen Anmeldeversuchen gesperrt. Ich brauche vor meiner Besprechung wieder Zugriff.“

choice

Zuständiges Team auswählen

score

Dringlichkeit auf einer geordneten Skala bewerten

noul

Wahrscheinlichkeit einer Zugriffssperre einschätzen

Beispielfragen; hier wird keine Live-Inferenz durchgeführt.

Parameter von Clef
27B
Kontext-Token in Workers AI
65,536
Pro Million Eingabe-Token
$0.24
Lizenz der offenen Modellgewichte
Apache-2.0

Spezifikationen und Preise von Workers AI wurden am 3. Oktober 2026 geprüft. Aktualisierungen finden Sie in der offiziellen Dokumentation.

01 / Funktionsweise

Definieren Sie die möglichen Antworten, bevor Sie fragen

Clef kombiniert ein Qwen-Basismodell mit einem gemeinsamen Schema-Kopf. Ein einziger Vorwärtsdurchlauf bewertet die gültigen Optionen über alle Fragen hinweg, ohne eine zwischenzeitliche Textantwort zu erzeugen.

choice

Eine Kategorie auswählen

Geben Sie benannte Optionen mit Beschreibungen an. Lesen Sie die ausgewählte Option, die Konfidenz und die Wahrscheinlichkeiten der einzelnen Optionen aus.

score

Auf einer Skala bewerten

Geben Sie geordnete Kriterien an. Die Antwort enthält einen wahrscheinlichkeitsgewichteten Wert über die bei null beginnenden Stufen.

noul

Eine Ja/Nein-Frage stellen

Lesen Sie die Wahrscheinlichkeit für true aus. Legen Sie den Schwellenwert Ihrer Anwendung fest und entscheiden Sie, wann eine Person das Ergebnis prüfen soll.

02 / Clef und Clef-flash

Zwei Größen für unterschiedliche Latenzanforderungen

Cloudflare positioniert Clef für Präzision und Clef-flash für zeitkritische Entscheidungen. Bewerten Sie beide anhand repräsentativer Beispiele aus Ihrem eigenen Arbeitsablauf.

ModellBasismodellVeröffentlichte Medianlatenz
ClefQwen3.8-27B209.3 ms
Clef-flashQwen3.5-9B38.8 ms

Die Latenzangaben stammen aus Cloudflares veröffentlichter interner Decision-Index-Auswertung. Sie garantieren keine bestimmte Latenz im Produktivbetrieb.

Details zur Veröffentlichung und Auswertung lesen

03 / Schnellstart mit Workers AI

Zustand senden. Fragen definieren. Antworten auslesen.

Fügen Sie Ihrem Worker eine AI-Bindung namens AI hinzu und rufen Sie dann @cf/cloudflare/clef auf. Das Beispiel bewertet drei Aspekte derselben Supportnachricht.

Aufbau der Anfrage

Übergeben Sie model, state und questions. Workers AI akzeptiert 1–64 Fragen und gibt die Antworten unter denselben Frage-IDs zurück.

Bilder in Workers AI

Die gehostete API akzeptiert bis zu vier eingebettete PNG-, JPEG- oder WebP-Bilder; entfernte Bild-URLs werden nicht akzeptiert. Die Größenbeschränkungen für Anfragen finden Sie in der Referenz.

Kompatibilität mit Jev / SystemOne

Clef verwendet das typisierte Anfrage- und Antwortformat. Aktualisieren Sie beim Anbieterwechsel die Authentifizierung und den Endpunkt und prüfen Sie die äußere Antwortstruktur des Anbieters.

Workers-AI-Referenz öffnen
Worker / TypeScript
export default {
  async fetch(request, env) {
    const result = await env.AI.run("@cf/cloudflare/clef", {
      model: "clef",
      state: "My account is locked after too many sign-in attempts.",
      questions: {
        team: {
          type: "choice",
          instructions: "Which team should help?",
          criteria: {
            accounts: "Sign-in and account access",
            billing: "Payments and invoices",
            technical: "Service errors and outages"
          }
        },
        urgency: {
          type: "score",
          instructions: "How urgently does this need attention?",
          criteria: ["Low", "Medium", "High"]
        },
        blocked: {
          type: "noul",
          instructions: "Is account access blocked?"
        }
      }
    });

    return Response.json(result);
  }
} satisfies ExportedHandler<{ AI: Ai }>;

04 / Betrieb nach Ihren Anforderungen

Gehostete Inferenz oder eigene Bereitstellung

Offene Modellgewichte

Die Veröffentlichung auf Hugging Face enthält das Basismodell und den gemeinsamen Schema-Kopf. Folgen Sie den Beispielen für load_release_model und systemone zur eigenen Bereitstellung, einschließlich lokaler Bild- und Videoeingaben.

Modellkarte lesen

Häufige Fragen

Vor der Integration von Clef

Erzeugt Clef Chatantworten?

Clef liefert Entscheidungen innerhalb der Grenzen Ihres Schemas. Nutzen Sie diese Antworten, um die nächste Aktion auszuwählen. Wenn Ihre Anwendung eine schriftliche Antwort benötigt, verwenden Sie ein textgenerierendes Modell.

Sind die Eingabegrenzen beim gehosteten und lokalen Betrieb identisch?

Nein. Workers AI gibt ein Kontextfenster von 65,536 Token an und dokumentiert eingebettete Bildeingaben. Die lokale Modellkarte beschreibt außerdem Videoeingaben, und encode_record verwendet standardmäßig 16,384 Token. Folgen Sie der Dokumentation für die von Ihnen verwendete Bereitstellung.

Kann ich Clef kommerziell nutzen?

Die Modellgewichte werden unter Apache-2.0 veröffentlicht. Prüfen Sie beim eigenen Betrieb die enthaltene Lizenz und die Hinweise sowie bei gehosteter Nutzung die Nutzungsbedingungen von Cloudflare.

Wie sollte ich die zurückgegebenen Wahrscheinlichkeiten verwenden?

Wählen Sie Schwellenwerte anhand gekennzeichneter Beispiele aus Ihrem Arbeitsablauf. Messen Sie fehlerhafte Aktionen und übersehene Fälle und leiten Sie unsichere Entscheidungen an ein Ausweichverfahren oder eine prüfende Person weiter.