Otwarte wagi Cloudflare do kierowania agentami: debiutuje rodzina Clef
1 października 2026 roku dostawca usług sieciowych Cloudflare ogłosił na swoim oficjalnym blogu, we wpisie podpisanym przez Michelle Chen, premierę Clef i Clef-flash. To modele określane jako „decyzyjne”, których wagi są udostępniane w serwisie Hugging Face na licencji Apache 2.0 i hostowane na platformie Workers AI. W przeciwieństwie do tradycyjnych systemów generatywnych narzędzia te nie tworzą swobodnego tekstu: ich konkretnym zadaniem jest klasyfikowanie danych, kierowanie zapytań i przypisywanie ocen, zwracanych w typowanych formatach wraz ze wskaźnikiem pewności. Jak wyjaśnia Michelle Chen we wpisie prezentującym, „model decyzyjny wykonuje klasyfikacje, aby pomóc agentom zdecydować, jak działać, na podstawie określonych prawdopodobieństw”. Oba modele bazują na architekturze Qwen (konkretnie Qwen3.8-27B w przypadku Clef i Qwen3.5-9B w przypadku Clef-flash, dotrenowanych adapterami niskiego rzędu o randze 256), mają okno kontekstu 64 000 tokenów oraz enkoder wizualny, dzięki któremu przetwarzają również obrazy.
W tej niszy, gdzie był już Jev System One firmy TypeSafe, a tego samego dnia pojawił się Strands Decider 2B od Amazona, Cloudflare stawia na opóźnienia: według firmy jej modele wyprzedzają inne modele decyzyjne, „z wyjątkiem Layi, która jest bardzo szybka, ale poświęca jakość”. Deklarowane wartości to mediana opóźnienia 209,3 milisekundy dla Clef, przy 95. percentylu 238,6 milisekundy, oraz 38,8 milisekundy dla Clef-flash, przy p95 równym 122,4 milisekundy; dla Jev System One deklarowana mediana wynosi 524,1 milisekundy. Clef jest ponadto zgodny z API Jev System One, pierwszego modelu decyzyjnego na rynku. Jeśli chodzi o koszty korzystania w Workers AI, branżowy serwis Developers Digest podaje stawki 0,24 dolara za milion tokenów wejściowych dla Clef i 0,09 dolara dla Clef-flash, bez opłat za tokeny wyjściowe. Firma oferuje też usługę dostosowania modeli przez uczenie ze wzmocnieniem, prowadzoną przez własny zespół inżynierów, przypominając, że „dostrajając model, można zrezygnować z części ogólnej wydajności w zamian za większą dokładność w konkretnej dziedzinie”; daty udostępnienia interfejsu samoobsługowego jednak jeszcze nie podano.
Przejrzystość tego przedsięwzięcia ma jednak pewne metodologiczne szare strefy. Benchmarki rozpowszechniane przez Cloudflare, wybrane spośród ocen Jev Decision Index — takie jak 98,47% dla Clef i 98,76% dla Clef-flash w BFCL case exact — mierzy sama firma i brakuje niezależnej weryfikacji. Wpis nie zapowiada też publikacji danych ani potoku treningowego, ograniczając się do wzmianki o „wewnętrznych syntetycznych zbiorach danych”: ten brak sytuuje premierę raczej wśród dystrybucji otwartych wag niż w pełni odtwarzalnych projektów open source. W oficjalnym wpisie brakuje również bezpośrednich porównań w zakresie ogólnego rozumowania, takich jak testy GPQA Diamond czy MMLU-Pro, w których według Developers Digest Jev System One miałby wyraźną przewagę.
Zastąpienie generowania tekstu strumieniem typowanych prawdopodobieństw to świetny inżynierski ruch, który zmniejsza opóźnienia agentów komercyjnych, a deklarowana przez firmę gwarancja, że „nie czytamy, nie przechowujemy ani nie trenujemy modeli na waszych zapytaniach czy odpowiedziach”, odpowiada na realną potrzebę bezpieczeństwa w firmach. Pozostaje jednak faktem, że skuteczność automatycznego decydenta mierzy się złożonością rozwidleń, z którymi potrafi sobie poradzić, a na ten temat opublikowane liczby nie mówią jeszcze nic.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Przeczytałam oficjalny wpis Cloudflare (blog.cloudflare.com/clef-decision-models, 1 października 2026): stamtąd pochodzą data, autorka, modele bazowe, licencja, okno kontekstu, enkoder wizualny, opóźnienia, benchmarki, dostrajanie i cytaty. Sprawdziłam stronę produktu Workers AI i porównałam dane z Developers Digest oraz wydaniem AI Weekly z 2 października: opóźnienia, licencja, rozmiary i data się zgadzają. Cen i porównań GPQA/MMLU-Pro nie ma w źródle pierwotnym; przypisałam je źródłu wtórnemu, nie Cloudflare.
- Incertezze
- Benchmarki i opóźnienia mierzy Cloudflare, bez niezależnej weryfikacji. Ceny (0,24 i 0,09 dolara za milion tokenów wejściowych) oraz przewaga Jev w GPQA Diamond i MMLU-Pro pochodzą z Developers Digest, nie z oficjalnego wpisu. Dane i potok treningowy nie są opublikowane: to otwarte wagi, nie odtwarzalny open source. Samoobsługowe dostrajanie nie ma daty.
- Perché pubblicarla
- Duży operator infrastruktury udostępnia na liberalnej licencji model z nowej kategorii, modeli decyzyjnych dla agentów, zgodny z Jev i obsługujący obrazy. To konkretny sygnał, jak industrializują się agenty: małe, szybkie i sprawdzalne komponenty zamiast uniwersalnego LLM na każdym etapie. Dotychczasowe artykuły o Jev i Strands Decider dotyczą innych modeli.