Tijdens de ‘Birthday Week’ op 8 oktober 2026 kondigde Cloudflare Clef aan: twee modellen met open gewichten die zijn ontwikkeld voor besluitvorming in plaats van tekstgeneratie. Het bedrijf stelde een multimodaal model met 27 miljard parameters en een kleinere versie met 9 miljard parameters, Clef‑Flash genaamd, beschikbaar via Workers AI en als downloadbare gewichten op Hugging Face.
Hoe de modellen werken
Clef krijgt een beschrijving van de situatie en een schema met getypeerde vragen als invoer en geeft voor elke toegestane optie een waarschijnlijkheid terug. Het kan tekst, JSON, afbeeldingen en video in één enkele forward pass verwerken, waardoor extra parsing van vrije tekst overbodig is. Het 27B-model heeft een contextvenster van 64 k tokens, twee keer zo groot als dat van vergelijkbare modellen zoals Jev van Typesafe.
Prestaties en toegang
Volgens Cloudflare haalt het 9B-model Clef‑Flash in de eigen benchmarks een mediane latentie van 38,8 ms; het grotere 27B-model komt uit op 209,3 ms. Omdat de modellen draaien op de edge-GPU’s van Cloudflare, verwacht het bedrijf een lage netwerklatentie voor beslissingen op kritieke paden. Ontwikkelaars kunnen de modellen met eigen data finetunen via een nieuwe dienst die van start gaat met ondersteuning van engineers en later selfservice wordt.
Waarom het ertoe doet
Voor ontwikkelaars die AI-agents bouwen, biedt Clef een kant-en-klare manier om snel gestructureerde beslissingen te nemen, zonder zelf parsers te hoeven schrijven. Dankzij de lage latentie is het 9B-model geschikt voor realtime taken, zoals het routeren van supporttickets of het filteren van botverkeer. Doordat de gewichten open beschikbaar zijn, kunnen teams het model aanpassen aan hun eigen data.