L’8 ott 2026, durante la «Birthday Week», Cloudflare ha annunciato Clef, una coppia di modelli open-weight progettati per prendere decisioni, non per generare testo. L’azienda ha reso disponibili tramite Workers AI e come pesi scaricabili su Hugging Face un modello multimodale da 27 miliardi di parametri e una versione più piccola da 9 miliardi, chiamata Clef-Flash.
Come funzionano i modelli
Clef riceve in ingresso una descrizione dello stato e uno schema con domande tipizzate, quindi restituisce una probabilità per ciascuna opzione consentita. Può elaborare testo, JSON, immagini o video in un unico passaggio, senza dover analizzare ulteriormente risposte in forma libera. Il modello 27B ha una finestra di contesto di 64 k token, il doppio rispetto a modelli comparabili come Jev di Typesafe.
Prestazioni e disponibilità
Secondo Cloudflare, nei benchmark interni il modello Clef-Flash 9B raggiunge una latenza mediana di 38,8 ms, mentre il modello più grande da 27B registra 209,3 ms. Poiché i modelli funzionano sulle GPU edge di Cloudflare, l’azienda prevede una bassa latenza di rete per le decisioni nei percorsi critici. Gli sviluppatori possono perfezionare i modelli con i propri dati tramite un nuovo servizio, inizialmente con il supporto di un ingegnere e in seguito disponibile in modalità self-service.
Perché conta
Per chi sviluppa agenti AI, Clef offre un modo pronto all’uso per prendere decisioni rapide e strutturate, senza dover scrivere parser personalizzati. La bassa latenza del modello 9B lo rende adatto ad attività in tempo reale, come instradare le richieste di assistenza o filtrare il traffico dei bot, mentre la distribuzione open-weight consente ai team di adattarlo ai propri dati.