Les poids ouverts de Cloudflare pour aiguiller les agents : la famille Clef fait ses débuts
Le 1er octobre 2026, l'entreprise de services réseau Cloudflare a annoncé sur son blog officiel, dans un billet signé Michelle Chen, la sortie de Clef et Clef-flash. Il s'agit de modèles dits « décisionnels », dont les poids sont distribués sur Hugging Face sous licence Apache 2.0 et hébergés sur la plateforme Workers AI. Contrairement aux systèmes génératifs classiques, ces outils ne produisent pas de texte libre : leur rôle concret est de classer des données, d'aiguiller des requêtes et d'attribuer des scores, renvoyés dans des formats typés et accompagnés d'un indice de confiance. Comme l'explique Michelle Chen dans le billet de présentation, « un modèle décisionnel effectue des classifications pour aider les agents à décider comment agir, sur la base de certaines probabilités ». Les deux modèles reposent sur l'architecture Qwen (plus précisément Qwen3.8-27B pour Clef et Qwen3.5-9B pour Clef-flash, post-entraînés avec des adaptateurs de bas rang de rang 256), disposent d'une fenêtre de contexte de 64 000 tokens et d'un encodeur visuel qui leur permet de traiter aussi des images.
Sur ce créneau, où l'on trouvait déjà Jev System One de TypeSafe et où Strands Decider 2B d'Amazon est arrivé le même jour, Cloudflare mise sur la latence : selon l'entreprise, ses modèles battent les autres modèles décisionnels, « sauf Laya, qui est très rapide mais sacrifie la qualité ». Les chiffres annoncés sont une latence médiane de 209,3 millisecondes pour Clef, avec un 95e percentile à 238,6 millisecondes, et de 38,8 millisecondes pour Clef-flash, avec un p95 à 122,4 millisecondes ; pour Jev System One, la médiane annoncée est de 524,1 millisecondes. Clef est en outre compatible avec l'API de Jev System One, le premier modèle décisionnel arrivé sur le marché. Côté coûts d'utilisation sur Workers AI, le média spécialisé Developers Digest fait état de tarifs de 0,24 dollar par million de tokens en entrée pour Clef et de 0,09 dollar pour Clef-flash, sans aucune facturation des tokens en sortie. L'entreprise propose aussi un service de personnalisation par apprentissage par renforcement, assuré par sa propre équipe d'ingénieurs, en rappelant que « lorsqu'on affine un modèle, on peut renoncer à une partie des performances générales en échange d'une meilleure précision dans un domaine spécifique » ; aucune date n'a toutefois été communiquée pour une interface en libre-service.
La transparence de l'opération comporte néanmoins quelques zones d'ombre méthodologiques. Les benchmarks diffusés par Cloudflare, choisis parmi les évaluations du Jev Decision Index — comme les 98,47 % de Clef et les 98,76 % de Clef-flash sur BFCL case exact —, sont mesurés par l'entreprise elle-même, sans vérification indépendante. Le billet n'annonce pas non plus la publication des données ni du pipeline d'entraînement et se contente d'évoquer des « jeux de données synthétiques internes » : une absence qui range cette sortie parmi les distributions de poids ouverts plutôt que parmi les projets open source entièrement reproductibles. Le billet officiel ne contient pas non plus de comparaisons directes sur le raisonnement général, comme les tests GPQA Diamond ou MMLU-Pro, domaines où, selon Developers Digest, Jev System One serait nettement devant.
Remplacer la génération de texte par un flux de probabilités typées est un excellent choix d'ingénierie pour réduire la latence des agents commerciaux, et la garantie affichée par l'entreprise — « nous ne lisons pas, ne stockons pas vos requêtes ou réponses et n'entraînons pas de modèles dessus » — répond à un vrai besoin de sécurité en entreprise. Reste que l'efficacité d'un décideur automatique se mesure à la complexité des embranchements qu'il sait affronter, et sur ce point les chiffres publiés ne disent encore rien.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- J'ai lu le billet officiel de Cloudflare (blog.cloudflare.com/clef-decision-models, 1er octobre 2026) : date, autrice, modèles de base, licence, fenêtre de contexte, encodeur visuel, latences, benchmarks, fine-tuning et citations en proviennent. J'ai vérifié la page produit de Workers AI et recoupé les données avec Developers Digest et l'édition d'AI Weekly du 2 octobre : latences, licence, tailles et date concordent. Les prix et les comparaisons GPQA/MMLU-Pro ne figurent pas dans la source primaire ; je les ai attribués à la source secondaire, pas à Cloudflare.
- Incertezze
- Benchmarks et latences sont mesurés par Cloudflare, sans vérification indépendante. Les prix (0,24 et 0,09 dollar par million de tokens en entrée) et l'avance de Jev sur GPQA Diamond et MMLU-Pro viennent de Developers Digest, pas du billet officiel. Les données et le pipeline d'entraînement ne sont pas publiés : poids ouverts, pas d'open source reproductible. Le fine-tuning en libre-service n'a pas de date.
- Perché pubblicarla
- Un grand opérateur d'infrastructure publie sous licence permissive un modèle d'une catégorie nouvelle, les modèles décisionnels pour agents, compatible avec Jev et doté d'une entrée visuelle. C'est un signe concret de l'industrialisation des agents : des composants petits, rapides et vérifiables plutôt qu'un LLM généraliste à chaque étape. Les articles déjà parus sur Jev et Strands Decider portent sur d'autres modèles.