I pesi aperti di Cloudflare per indirizzare gli agenti: debutta la famiglia Clef
Il primo ottobre 2026, l'azienda di servizi di rete Cloudflare ha annunciato sul proprio blog ufficiale, in un articolo firmato da Michelle Chen, il rilascio di Clef e Clef-flash. Si tratta di modelli definiti "decisionali" con pesi distribuiti su Hugging Face sotto licenza Apache 2.0 e ospitati sulla piattaforma Workers AI. A differenza dei sistemi generativi tradizionali, questi strumenti non producono testo libero: il loro compito concreto è classificare dati, instradare richieste e assegnare punteggi restituiti in formati tipizzati e corredati da un indice di confidenza. Come spiegato da Michelle Chen nel post di presentazione, "un modello decisionale esegue classificazioni per aiutare gli agenti a decidere come agire, sulla base di determinate probabilità". Entrambi i modelli, basati sull'architettura Qwen (nello specifico Qwen3.8-27B per Clef e Qwen3.5-9B per Clef-flash, post-addestrati con adattatori low-rank di rango 256), integrano una finestra di contesto di 64.000 token e un encoder visivo utile per elaborare anche immagini.
Nella nicchia, dove c'era già Jev System One di TypeSafe e lo stesso giorno è arrivato Strands Decider 2B di Amazon, Cloudflare punta sulla latenza: secondo l'azienda i suoi modelli battono gli altri decisionali, "tranne Laya, che è molto veloce ma sacrifica la qualità". I numeri dichiarati sono una latenza mediana di 209,3 millisecondi per Clef, con un novantacinquesimo percentile di 238,6 millisecondi, e di 38,8 millisecondi per Clef-flash, con p95 a 122,4 millisecondi; per Jev System One la mediana dichiarata è di 524,1 millisecondi. Clef è inoltre compatibile con l'API di Jev System One, il primo modello decisionale arrivato sul mercato. Sul fronte dei costi di utilizzo su Workers AI, la testata specializzata Developers Digest riporta tariffe pari a 0,24 dollari per milione di token in input per Clef e 0,09 dollari per Clef-flash, senza alcun addebito per i token in output. L'azienda offre anche un servizio di personalizzazione tramite apprendimento per rinforzo gestito dal proprio team ingegneristico, ricordando che "quando si perfeziona un modello, si può rinunciare a parte delle prestazioni generali in cambio di una maggiore accuratezza in un dominio specifico", sebbene non sia ancora stata comunicata la data di rilascio di un'interfaccia self-service.
La trasparenza dell'operazione presenta tuttavia alcune zone d'ombra metodologiche. I benchmark diffusi da Cloudflare, scelti tra le valutazioni del Jev Decision Index — come il 98,47% di Clef e il 98,76% di Clef-flash su BFCL case exact — sono misurati dall'azienda stessa e manca una verifica indipendente. Il post non annuncia poi la pubblicazione dei dati né della pipeline di addestramento e si limita a citare "dataset sintetici interni": un'assenza che colloca il rilascio tra le distribuzioni di pesi aperti più che tra i progetti open source pienamente riproducibili. Dal post ufficiale mancano anche i confronti diretti sulle capacità di ragionamento generale, come i test GPQA Diamond o MMLU-Pro, ambiti nei quali, secondo Developers Digest, Jev System One sarebbe nettamente avanti.
Sostituire la generazione di testo con un flusso di probabilità tipizzate è un'ottima mossa ingegneristica per ridurre la latenza degli agenti commerciali, e la garanzia dichiarata dall'azienda secondo cui "non leggiamo, memorizziamo o addestriamo i modelli sulle vostre richieste o risposte" risponde a una reale esigenza di sicurezza aziendale. Resta che l'efficacia di un decisore automatico si misura sulla complessità dei bivi che sa affrontare, e su quella parte i numeri pubblicati non dicono ancora nulla.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ho letto il post ufficiale di Cloudflare (blog.cloudflare.com/clef-decision-models, 1° ottobre 2026): da lì vengono data, autrice, modelli base, licenza, finestra di contesto, encoder visivo, latenze, benchmark, fine-tuning e citazioni. Ho controllato la pagina prodotto di Workers AI e confrontato i dati con Developers Digest e con AI Weekly del 2 ottobre: latenze, licenza, dimensioni e data coincidono. Prezzi e confronti GPQA/MMLU-Pro non sono nella fonte primaria: li ho attribuiti alla fonte secondaria, non a Cloudflare.
- Incertezze
- Benchmark e latenze li misura Cloudflare, senza verifica indipendente. I prezzi (0,24 e 0,09 dollari per milione di token in input) e il vantaggio di Jev su GPQA Diamond e MMLU-Pro vengono da Developers Digest, non dal post ufficiale. Dati e pipeline di addestramento non sono pubblicati: pesi aperti, non open source riproducibile. Il fine-tuning self-service non ha una data.
- Perché pubblicarla
- Un grande operatore infrastrutturale rilascia con licenza permissiva un modello di una categoria nuova, i modelli decisionali per agenti, compatibile con Jev e con input visivo. È un segnale concreto di come si industrializzano gli agenti: componenti piccoli, veloci e verificabili al posto di un LLM generalista a ogni passaggio. Gli articoli già usciti su Jev e Strands Decider trattano altri modelli.