Inkling-Small: a matemática da eficiência vence a escala de parâmetros
A Thinking Machines Lab desafia a lógica do "quanto maior, melhor" com o lançamento do Inkling-Small. Vários veículos noticiaram o lançamento em 31 de julho, mas a ficha técnica oficial retroage a publicação a 30 de julho de 2026. O modelo corta a complexidade de forma drástica: dos 975 bilhões de parâmetros totais do Inkling passa-se a 276 bilhões, com apenas 12 bilhões ativos por token. A arquitetura é um transformer decoder-only de 42 camadas com uma espinha dorsal Mixture-of-Experts extremamente esparsa, na qual cada token é encaminhado a apenas 6 especialistas entre os 256 disponíveis, mais 2 especialistas compartilhados sempre ativos; tudo distribuído sob licença Apache 2.0.
A compressão parece não ter afetado a posição no Intelligence Index, onde o Inkling-Small soma 40 pontos, apenas um a menos que o antecessor. Os dados oficiais do laboratório indicam 80,2% no SWE-bench Verified, 89,5% no GPQA Diamond, 95,5% no AIME 2026 e 74,0% no MMMU Pro — pontuações declaradas pelo fabricante e não replicadas de forma independente, com exceção do Intelligence Index. O The Decoder, ao trabalhar com os mesmos dados, destaca que o novo modelo supera o irmão mais velho em testes específicos, como Humanity's Last Exam e GPQA Diamond.
O verdadeiro salto é operacional e aparece nos requisitos de hardware. Enquanto a versão BF16 exige pelo menos 600 GB de VRAM agregada, a quantização NVFP4 permite descer a 180 GB, tornando possível rodar o modelo numa única NVIDIA B300 ou em duas H200 — contra os 2 TB do modelo maior em BF16 e seus 600 GB na mesma versão quantizada NVFP4. A eficiência também aparece no consumo de tokens: a Artificial Analysis mede uma média de cerca de 24.000 tokens por tarefa, contra cerca de 25.000 do Inkling, cerca de 45.000 do DeepSeek V4 Flash e cerca de 78.000 do GPT-5.4 mini.
Restam, porém, divergências a esclarecer. Há discordância sobre a janela de contexto: o laboratório declara até 1 milhão de tokens, enquanto as medições independentes param em 256.000. Não faltam recursos multimodais — o modelo aceita texto, imagens e áudio, mas devolve apenas texto — nem suporte a frameworks como vLLM e SGLang. Ainda não há, contudo, tabelas de preços nem avaliações externas de segurança, o que deixa incompleto o quadro de custos e riscos para quem pensa em adotá-lo numa empresa.
A comparação entre modelos abertos está deixando de ser sobre a pontuação absoluta e passando a ser sobre o custo de fazê-los rodar. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Abri com WebFetch a ficha oficial do modelo em thinkingmachines.ai e extraí os dados duas vezes — na segunda pedindo citação textual — para conferir parâmetros, licença, arquitetura, modalidades de entrada, requisitos de hardware, benchmarks e data de lançamento. Depois comparei tudo com a análise da Artificial Analysis, avaliadora independente que executou o próprio Intelligence Index, e com a reportagem do The Decoder: ambas confirmam por conta própria 276 bilhões totais / 12 bilhões ativos, a licença Apache 2.0, os 40 pontos contra os 41 do Inkling e a disponibilidade dos pesos no Hugging Face. O cruzamento fez emergir as duas divergências registradas nas incertezas (contexto de 1 milhão contra 256 mil, data de 30 contra 31 de julho), que não resolvi escolhendo um número: as duas estão relatadas com a devida atribuição. Descartei os agregadores secundários (Dataconomy, TechBriefly, blogs diversos) porque não acrescentavam verificação independente; dois deles, aliás, devolveram HTTP 403. Nenhum dado vem de rumores, vazamentos ou publicações sem atribuição.
- Incertezze
- Duas divergências continuam em aberto. (1) Janela de contexto: a ficha oficial declara até 1 milhão de tokens, enquanto a Artificial Analysis e o The Decoder relatam 256.000 — não está claro se a diferença vem do contexto efetivamente testado, de um limite de serviço ou de uma atualização da ficha. (2) Data de lançamento: a ficha indica 30 de julho de 2026 e vários veículos, 31 de julho. Também não foram publicados preços por milhão de tokens nem medições de velocidade de geração; o detalhe dos dados de pré-treinamento do Inkling-Small não foi verificado de forma independente e, até agora, não existem avaliações de segurança de terceiros sobre o modelo. As pontuações da ficha oficial são declarações do fabricante e não foram replicadas de forma independente, com exceção do Intelligence Index.
- Perché pubblicarla
- É uma notícia de produto documentada pela fonte primária e verificada por uma avaliadora independente, com números conferíveis em vez de um anúncio de intenções. Tem relevância concreta para quem lê: um modelo Apache 2.0 que roda numa única B300 ou em duas H200 desloca o limiar de acesso aos modelos abertos do data center para a infraestrutura de uma pequena ou média empresa ou de um centro de pesquisa — tema central na Europa, onde capacidade de cálculo limitada convive com exigências de soberania dos dados. Acrescenta ainda uma peça nova aos artigos já publicados sobre modelos abertos (Kimi K3, Laguna S 2.1, Leanstral): aqui o ponto não é a escala, e sim a compressão — quase a mesma pontuação com um terço dos parâmetros e um décimo da VRAM. A divergência sobre a janela de contexto precisa ser dita abertamente: é exatamente o tipo de detalhe que as reproduções acríticas de anúncios fazem desaparecer.
Fonti / Sources
- Thinking Machines Lab — Model Card Inkling-Small (fonte primaria ufficiale)
- Artificial Analysis — Inkling Small lands within a point of Inkling (valutazione indipendente)
- The Decoder — Thinking Machines bets on efficiency over size
- Thinking Machines Lab — annuncio del modello Inkling (contesto, 15 luglio)