Cloudflare brengt Clef uit: open-weight beslismodellen met Qwen als basis
Cloudflare heeft twee eigen beslismodellen uitgebracht, Clef en Clef-flash, en zet ze onder een Apache 2.0-licentie op Hugging Face. De modellen draaien op Workers AI, maar zijn ook lokaal te gebruiken. Dat staat in de aankondiging op de Cloudflare-blog.
Wat een beslismodel doet
Een decision model is geen chatbot. Het beantwoordt afgebakende vragen met een getypeerd antwoord en een kans: ja/nee, een keuze uit een lijst, of een score. Je geeft het een stuk context mee en een set vragen, en krijgt structuur terug waar je code direct op kan routeren.
Cloudflare geeft als voorbeeld een supportbericht dat binnenkomt: is dit urgent, welk team moet het oppakken, hoe ernstig is de impact. Het punt daarvan is dat een agent zo'n beslissing programmatisch kan nemen zonder dat er een mens in de lus zit, en alleen opschaalt naar een mens wanneer dat nodig is.
Intern gebruikt Cloudflare het model om domeinen te classificeren voor zijn Threat Intelligence-team. Het bedrijf schrijft dat Clef een website in 2,2 seconden ophaalt, rendert en indeelt, tegenover 4,7 seconden voor gpt-oss-120b, dat bovendien maar twee categorieën teruggaf.
Qwen onder de motorkap
Clef is gebouwd op een LLM-fundament. Volgens The Register gebruikt Clef een speciaal nagetrainde, bevroren versie van Qwen3.8-27B en Clef-flash een van Qwen3.5-9B, waarbij de Qwen-backbone alleen een prefill-pass doet en de keuzes daarna parallel worden gescoord.
Twee dingen die Clef volgens Cloudflare onderscheiden van Typesafe's Jev-model, de nieuwkomer waar het zich expliciet tegen afzet: Clef heeft een vision-encoder en kan dus ook beelden classificeren, en het contextvenster is 64k in plaats van 32k.
Benchmarks van de maker zelf
Cloudflare publiceert scores tegen de Jev Decision Index. Op BANKING77 (macro-F1) komt Clef op 94,20 tegen 79,74 voor Jev; op een set over huishoudelijke apparaten 82,95 voor Clef en 97,73 voor Clef-flash, tegen 52,27 voor Jev. Jev wint op When2Call (80,97 tegen 72,37) en op BRIGHT (47,52 tegen 45,91). De mediane latency ligt volgens die tabel op 209,3 ms voor Clef en 38,8 ms voor Clef-flash, tegen 524,1 ms voor Jev.
Die cijfers komen van Cloudflare zelf en zijn nog niet onafhankelijk gereproduceerd voor de officiële ranglijst, merkt The Register op. Cloudflare noemt de modellen "open source", maar productmanager Michelle Chen bevestigde aan The Register dat de trainingsdata niet openbaar zijn. Open weights dus, geen open dataset.
Wat het kost om het zelf te draaien
Chen gaf The Register ook de hardware-eisen: Clef-flash heeft een GPU met minimaal 41 GB VRAM nodig, Clef 85 GB, uitgaande van één gelijktijdige aanvraag en een contextvenster van 64k. Dat is geen homelab-formaat.
Via Workers AI kost Clef 0,24 dollar per miljoen tokens, bijna zes keer de 0,042 dollar die Jev rekent. Daar staat tegenover dat de API volledig Jev-compatibel is, zodat het als drop-in vervanging te proberen is. Cloudflare kondigde daarnaast een reinforcement learning-product aan waarmee klanten Clef op hun eigen use case kunnen finetunen.