Cloudflare bracht op 1 oktober 2026 Clef en Clef-flash uit, twee open-weight modellen die een vaste set vragen beantwoorden met kansen in plaats van tekst. Clef-flash geeft een beslissing in 38,8 milliseconden mediaan. Beide modellen staan onder Apache 2.0 op Hugging Face en draaien gehost op Workers AI van Cloudflare.
Wat zijn Cloudflare Clef en Clef-flash?
Een beslismodel doet maar één ding. Je geeft het een document en een lijst met toegestane antwoorden, en het geeft per antwoord een kans terug. Het schrijft nooit een zin. Dat past op het deel van een AI-agent dat niet schrijft maar kiest: welke tool je aanroept, of een invoer veilig is, in welke van twaalf supportcategorieën een ticket hoort.
Clef heeft 27 miljard parameters en is gebouwd op Qwen3.8-27B. Clef-flash heeft 9 miljard en is gebouwd op Qwen3.5-9B. Beide modellen kennen drie vraagvormen: ja of nee, kies één benoemde optie, en geef een cijfer op een schaal. Beide nemen tot 64 vragen in één verzoek. En beide lezen afbeeldingen en videoframes naast tekst, wat het gevestigde beslismodel Jev van TypeSafe niet doet.
Cloudflare hield ook de Jev API aan. Clef beantwoordt dezelfde calls, dus overstappen is een ander endpoint en geen herschrijving.
Clef benchmarks, latency en contextvenster
De cijfers die ertoe doen zijn snelheid, contextlengte en de ene benchmark waar Clef ruim voorligt.
| Aspect | Clef | Concurrent |
|---|---|---|
| Mediane beslissingslatency | 209,3 ms | Clef-flash: 38,8 ms |
| Contextvenster | 64.000 tokens | Jev: 32.000 tokens |
| BANKING77 (bankvragen sorteren) | 94,20 macro-F1 | Jev: 79,74 |
| BFCL (de juiste tool kiezen) | 98,5% | Clef-flash: 98,76% exacte match |
| Afbeeldingen en video als invoer | Ja | Jev: alleen tekst |
| Licentie en gewichten | Apache 2.0 op Hugging Face | Jev: alleen gehoste API |
Dit zijn de eigen cijfers van Cloudflare, gemeten over 43 evaluatiesets en gepubliceerd bij de modelkaart. Cloudflare zegt niet waar de cijfers van Jev vandaan komen, dus lees de vergelijkende rijen als het verhaal van de leverancier en niet als een onafhankelijke hermeting.
Wat Cloudflare niet vertelt over Clef
Twee dingen vallen op. De aankondiging noemt geen prijs. De changelog verwijst naar een prijspagina, en de bedragen die nu rondgaan, $0,24 per miljoen invoertokens voor Clef en $0,09 voor Clef-flash, komen uit secundaire berichtgeving en niet van Cloudflare zelf. Bij een model dat verkocht wordt op kosten per beslissing verwacht je dat getal als eerste.
Het tweede is de benchmark waar Cloudflare niet mee opent. Jev verslaat Clef nog steeds op GPQA Diamond en MMLU-Pro, de twee sets die kennis testen in plaats van sorteren. Moeten jouw beslissingen het model dingen laten wéten in plaats van aangeleverde dingen indelen, dan valt het gat de andere kant op.
Hoe Clef past in de stortvloed aan beslismodellen
In acht dagen tijd verschenen vier beslismodellen. Liquid AI bracht d1 uit op 30 september. Cloudflare en Amazon kwamen beide op 1 oktober, Amazon met Strands Decider 2B. Ze richten zich allemaal op Jev en maken allemaal hetzelfde punt: een agent die een model van 27B om JSON vraagt, betaalt voor een vermogen dat hij niet gebruikt.
De hoek van Cloudflare is distributie, niet architectuur. Clef draait op hetzelfde edge-netwerk waar jouw Workers al staan, en daarom is 38,8 milliseconden ook in productie geloofwaardig en niet alleen op een testopstelling. Het bedrijf kondigde daarnaast een reinforcement learning-dienst aan om Clef op jouw eigen verkeer bij te trainen, gebouwd uit AI Gateway, Workers AI en Containers. Dat deel is nog niet selfservice. Het start als een traject met engineers van Cloudflare, met een publiek platform dat later volgt.
Wat dit betekent
De moeite waard om nu te testen als je al Workers draait en je agent meer routeringscalls doet dan generatiecalls. Clef-flash is het model om mee te beginnen, niet Clef. Bij 38,8 milliseconden is een beslissing geen stap meer waar de gebruiker op wacht, en een model van 9B op die snelheid is goedkoop genoeg om vóór elk verzoek te zetten in plaats van alleen bij twijfel. De beeldinvoer is hier het echte verschil: screenshots triageren, documenttypes herkennen en geüploade afbeeldingen modereren wordt één call in plaats van een pijplijn.
Rustig negeren als je niet op Cloudflare zit en geen 27 miljard parameters zelf wilt hosten. De Apache 2.0-licentie is echt en de gewichten staan er, maar zelf hosten levert je een classifier op en geen algemeen model. Een bijgetrainde kleine encoder haalt het vaak op één smalle taak voor een fractie van de hardware. Het punt om in de gaten te houden is niet de voorsprong op Jev, want dat is de tabel van één leverancier. Het is de vraag of vier labs die in acht dagen hetzelfde product uitbrengen betekent dat beslismodellen voor de kerst een commoditylaag worden. In dat geval is de prijs die Cloudflare niet publiceerde het enige cijfer dat telt.
Voor meer informatie, bekijk de officiële aankondiging van Clef op de blog van Cloudflare.