De onverwachte eenvoud van het comprimeren van AI-geheugen
Het beheer van het werkgeheugen in generatieve modellen, de zogeheten KV-cache, is een van de meest kritieke knelpunten geworden zodra redeneerketens lang worden. Tot nu toe was de dominante oplossing een reeks geraffineerde algoritmen, zoals SnapKV of TriAttention, ontworpen om voor elk tekstfragment een score voor toekomstig nut te berekenen en alleen te bewaren wat cruciaal wordt geacht. Een preprint die op 3 september 2026 op arXiv is geplaatst (arXiv:2609.03430, Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning), van onderzoekers van Salesforce AI Research en de University of Illinois Urbana-Champaign, zet die aanpak op losse schroeven: complexe selectiesignalen zouden geen doorslaggevende bijdrage leveren aan de kwaliteit van het resultaat.
De voorgestelde techniek, Random Attention genoemd en met Apache 2.0-licentie in de bijbehorende coderepository gepubliceerd, volgt een logica zonder enige relevantieberekening: ze beschermt de tokens van de oorspronkelijke prompt en die van het meest recente venster, en gooit de rest uniform willekeurig weg binnen elke attention-head. Volgens de stelling van het paper beschermen redeneersporen zichzelf, dankzij redundantie die zowel door de tekst als over de heads van het model verspreid ligt. Op MATH500 met Qwen3-4B scoort de willekeurige methode 0,874 tegen 0,864 van TriAttention en 0,703 van SnapKV; op GPQA-Diamond 0,530 tegen 0,533 — verschillen in de orde van een procentpunt, in beide richtingen. In de metingen die de auteurs rapporteren op een H200-GPU met vLLM verlaagt het schrappen van de scoringsfase de latency per stap van de 1,47-1,64 milliseconden van TriAttention naar 0,30 milliseconden. Bij generaties van 32 duizend tokens levert dat een doorvoer op van 1,6 tot 2,7 keer die van volledige attention, en 32-43% hoger dan TriAttention, de sterkste concurrent.
Het werk is niet door peer review gegaan, en het is hetzelfde team dat de methode tekent dat nauwkeurigheid, doorvoer en latency heeft gemeten; onafhankelijke reproducties of controles door derden zijn er nog niet. De gedocumenteerde analyse blijft bovendien beperkt tot vier specifieke modellen, grotendeels uit de Qwen3-familie plus Phi-4-reasoning — terwijl de repository optionele ondersteuning voor DeepSeek-R1-Distill-Llama-8B noemt — en vertoont terugval op programmeercode, waar de lengte van de prompts de vaste capaciteit van de cache snel opsoupeert. De geteste budgetten — ongeveer 4 keer compressie, 3 op LiveCodeBench — zijn door de auteurs gekozen. Buiten die omheining zegt het paper niets: andere modelfamilies, agressievere compressie, of lange teksten die geen redeneerketens zijn, waar de redundantie van het spoor — precies het mechanisme waarmee de auteurs verklaren waarom toeval werkt — eenvoudigweg ontbreekt. Het systeem stuit daarnaast op een duidelijk logisch obstakel bij zeldzame of niet-herhaalde feiten, die de willekeurige methode onherstelbaar dreigt te wissen.
Als externe controles de cijfers bevestigen, betreft het resultaat één precies vakje — welk token uit de cache vliegt terwijl een model redeneert — en suggereert het dat daar het keuzecriterium minder weegt dan de redundantie die het redeneerspoor vanzelf voortbrengt. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik heb op arXiv de pagina abs/2609.03430 en de volledige tekst van het paper geopend: daaruit komen de titel, de auteurs, de indieningsdatum (3 september 2026), de modellen, taken, cachebudgetten, baselines, nauwkeurigheidscijfers, doorvoer, latency per eviction en hardware. De officiële repository SalesforceAIResearch/Random-Attention bevestigt de Apache 2.0-licentie, de naam van de methode (random_pp), de omschrijving 'signal-free' en de lijst met ondersteunde modellen. Als onafhankelijke bevestiging controleerde ik de berichtgeving van AI Weekly van 4 september 2026, met dezelfde cijfers (32-43% doorvoer, vier modellen, zes taken) en de opmerking dat de samenvatting niet vermeldt welke modellen, welke taken en welke vergelijkingsmethode. De affiliaties staan in de volledige tekst, niet op de abs-pagina. Niets is overgenomen van aggregators of mirrors.
- Incertezze
- Het is een preprint, geen peer-reviewed werk, en alle metingen — nauwkeurigheid, doorvoer, latency per eviction — zijn door de auteurs zelf geproduceerd: op het moment van controleren waren er geen onafhankelijke reproducties. De evaluatie bestrijkt vier modellen (drie uit dezelfde Qwen3-familie, plus Phi-4-reasoning) en zes taken uit wiskunde, wetenschap en programmeren, met cachebudgetten die door de auteurs zijn gekozen; het paper toont niet aan dat de conclusie standhoudt bij andere modelfamilies, agressievere budgetten of long-contexttaken die geen redeneerketens zijn, waar de redundantie van het spoor die het resultaat moet verklaren mogelijk ontbreekt. Het doorvoervoordeel is gemeten op één specifieke configuratie (H200, vLLM met PagedAttention, generaties van 32k tokens). De GitHub-pagina toont geen expliciete aanmaak- of updatedatums, en er is geen aankondiging op de officiële blog van Salesforce AI Research: de communicatie liep via paper en code.
- Perché pubblicarla
- Dit is een negatief resultaat dat meer waard is dan veel aankondigingen: als het standhoudt, wordt een hele onderzoekslijn rond belangrijkheidsscores voor de KV-cache weggegooid werk, omdat een willekeurige keuze dezelfde nauwkeurigheid haalt tegen vijf keer minder kosten per evictieronde. Het heeft alles om zonder hype verteld te worden — open Apache 2.0-code, expliciete cijfers, door de auteurs erkende beperkingen — en het raakt een concreet punt voor iedereen die redeneermodellen serveert: hoeveel verzoeken er op één GPU passen. De invalshoek van het artikel is de afstand tussen de kracht van de stelling (het signaal is niet nodig) en de smalte van de verificatie: vier modellen, zes benchmarks, alle metingen in eigen huis en geen externe replicatie.
Fonti / Sources
- arXiv:2609.03430 — Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning (paper, fonte primaria)
- Testo integrale del paper (HTML arXiv)
- Repository ufficiale del codice — SalesforceAIResearch/Random-Attention (Apache 2.0)
- AI Weekly — copertura indipendente del preprint (4 settembre 2026)