Os pesos abertos da Cloudflare para direcionar agentes: estreia a família Clef
Em 1º de outubro de 2026, a empresa de serviços de rede Cloudflare anunciou em seu blog oficial, em um artigo assinado por Michelle Chen, o lançamento de Clef e Clef-flash. São modelos definidos como «de decisão», com pesos distribuídos no Hugging Face sob licença Apache 2.0 e hospedados na plataforma Workers AI. Ao contrário dos sistemas generativos tradicionais, essas ferramentas não produzem texto livre: sua tarefa concreta é classificar dados, rotear solicitações e atribuir pontuações, devolvidas em formatos tipados e acompanhadas de um índice de confiança. Como explica Michelle Chen no post de apresentação, «um modelo de decisão realiza classificações para ajudar os agentes a decidir como agir, com base em determinadas probabilidades». Os dois modelos se baseiam na arquitetura Qwen (especificamente Qwen3.8-27B para Clef e Qwen3.5-9B para Clef-flash, pós-treinados com adaptadores de baixo posto, de posto 256), têm janela de contexto de 64.000 tokens e um codificador visual que permite processar também imagens.
Nesse nicho, onde já estava o Jev System One da TypeSafe e no mesmo dia chegou o Strands Decider 2B da Amazon, a Cloudflare aposta na latência: segundo a empresa, seus modelos superam os demais modelos de decisão, «exceto o Laya, que é muito rápido, mas sacrifica a qualidade». Os números declarados são uma latência mediana de 209,3 milissegundos para Clef, com percentil 95 de 238,6 milissegundos, e de 38,8 milissegundos para Clef-flash, com p95 de 122,4 milissegundos; para o Jev System One, a mediana declarada é de 524,1 milissegundos. O Clef também é compatível com a API do Jev System One, o primeiro modelo de decisão a chegar ao mercado. Quanto aos custos de uso no Workers AI, o veículo especializado Developers Digest informa tarifas de 0,24 dólar por milhão de tokens de entrada para Clef e 0,09 dólar para Clef-flash, sem cobrança pelos tokens de saída. A empresa oferece ainda um serviço de personalização por aprendizado por reforço conduzido pela sua própria equipe de engenharia, lembrando que «ao ajustar um modelo, pode-se abrir mão de parte do desempenho geral em troca de maior precisão em um domínio específico», embora ainda não tenha divulgado a data de uma interface self-service.
A transparência da operação, porém, tem algumas zonas cinzentas metodológicas. Os benchmarks divulgados pela Cloudflare, escolhidos entre as avaliações do Jev Decision Index — como os 98,47% do Clef e os 98,76% do Clef-flash no BFCL case exact —, são medidos pela própria empresa, sem verificação independente. O post também não anuncia a publicação dos dados nem do pipeline de treinamento e se limita a citar «conjuntos de dados sintéticos internos»: uma ausência que coloca o lançamento entre as distribuições de pesos abertos, e não entre os projetos open source totalmente reproduzíveis. Faltam ainda no post oficial comparações diretas de raciocínio geral, como os testes GPQA Diamond ou MMLU-Pro, áreas em que, segundo o Developers Digest, o Jev System One estaria claramente à frente.
Substituir a geração de texto por um fluxo de probabilidades tipadas é uma ótima jogada de engenharia para reduzir a latência dos agentes comerciais, e a garantia declarada pela empresa de que «não lemos, armazenamos nem treinamos modelos com suas solicitações ou respostas» atende a uma necessidade real de segurança corporativa. Resta que a eficácia de um decisor automático se mede pela complexidade das bifurcações que ele consegue enfrentar, e sobre isso os números publicados ainda não dizem nada.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Li o post oficial da Cloudflare (blog.cloudflare.com/clef-decision-models, 1º de outubro de 2026): dali vêm data, autora, modelos-base, licença, janela de contexto, codificador visual, latências, benchmarks, ajuste fino e citações. Verifiquei a página do produto Workers AI e comparei os dados com o Developers Digest e a edição do AI Weekly de 2 de outubro: latências, licença, tamanhos e data coincidem. Preços e comparações GPQA/MMLU-Pro não estão na fonte primária; atribuí-os à fonte secundária, não à Cloudflare.
- Incertezze
- Benchmarks e latências são medidos pela Cloudflare, sem verificação independente. Os preços (0,24 e 0,09 dólar por milhão de tokens de entrada) e a vantagem do Jev em GPQA Diamond e MMLU-Pro vêm do Developers Digest, não do post oficial. Dados e pipeline de treinamento não foram publicados: pesos abertos, não open source reproduzível. O ajuste fino self-service não tem data.
- Perché pubblicarla
- Um grande operador de infraestrutura publica com licença permissiva um modelo de uma categoria nova, os modelos de decisão para agentes, compatível com o Jev e com entrada visual. É um sinal concreto de como os agentes estão sendo industrializados: componentes pequenos, rápidos e verificáveis no lugar de um LLM generalista em cada etapa. Os artigos já publicados sobre Jev e Strands Decider tratam de outros modelos.