Неожиданная простота сжатия памяти искусственного интеллекта
Управление рабочей памятью генеративных моделей, так называемым KV-кэшем, стало одним из самых узких мест, как только цепочки рассуждений вытягиваются в длину. До сих пор преобладающим решением были изощрённые алгоритмы вроде SnapKV или TriAttention, рассчитывающие для каждого фрагмента текста оценку будущей полезности и сохраняющие только то, что признано существенным. Препринт, размещённый на arXiv 3 сентября 2026 года (arXiv:2609.03430, Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning), написанный исследователями из Salesforce AI Research и University of Illinois Urbana-Champaign, ставит этот подход под сомнение: сложные сигналы отбора, по их мнению, не вносят решающего вклада в качество результата.
Предложенная методика, названная Random Attention и выложенная под лицензией Apache 2.0 в соответствующем репозитории кода, обходится вовсе без вычисления релевантности: она защищает токены исходного запроса и токены самого свежего окна, а остальные отбрасывает равномерно случайно внутри каждой головы внимания. По тезису статьи, следы рассуждения защищают себя сами — благодаря избыточности, распределённой и по тексту, и между головами модели. На MATH500 с Qwen3-4B случайный метод даёт 0,874 против 0,864 у TriAttention и 0,703 у SnapKV; на GPQA-Diamond — 0,530 против 0,533, то есть расхождения порядка процентного пункта в обе стороны. В измерениях, приведённых авторами на GPU H200 в среде vLLM, отказ от этапа скоринга снижает задержку шага с 1,47-1,64 миллисекунды у TriAttention до 0,30 миллисекунды. На генерациях в 32 тысячи токенов это даёт пропускную способность в 1,6-2,7 раза выше полного внимания и на 32-43% выше, чем у TriAttention, самого сильного конкурента.
Работа не проходила рецензирование, и точность, пропускную способность и задержку измеряла та же команда, что подписала метод; независимых воспроизведений или сторонних проверок пока нет. Задокументированный анализ к тому же ограничен четырьмя конкретными моделями, преимущественно семейства Qwen3, плюс Phi-4-reasoning — тогда как репозиторий упоминает опциональную поддержку DeepSeek-R1-Distill-Llama-8B — и показывает просадки на программном коде, где длина запросов быстро съедает фиксированную ёмкость кэша. Проверенные бюджеты — сжатие примерно в 4 раза, в 3 на LiveCodeBench — выбрали сами авторы. За пределами этого периметра статья не говорит ничего: другие семейства моделей, более агрессивное сжатие или длинные тексты, не являющиеся цепочками рассуждений, где избыточности следа — того самого механизма, которым авторы объясняют работу случая, — попросту нет. Кроме того, система упирается в очевидное логическое препятствие перед редкими или не повторяющимися фактами, которые случайный метод рискует стереть безвозвратно.
Если внешние проверки подтвердят цифры, результат будет касаться одной точно очерченной клетки — какой токен выбросить из кэша, пока модель рассуждает, — и подскажет, что там критерий выбора весит меньше, чем избыточность, которую след рассуждения порождает сам по себе. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Я открыла на arXiv карточку abs/2609.03430 и полный текст статьи: оттуда взяты заголовок, авторы, дата подачи (3 сентября 2026), модели, задачи, бюджеты кэша, базовые методы, цифры точности, пропускная способность, задержка на одно вытеснение и оборудование. Официальный репозиторий SalesforceAIResearch/Random-Attention подтверждает лицензию Apache 2.0, название метода (random_pp), описание «signal-free» и список поддерживаемых моделей. Как независимое подтверждение я проверила материал AI Weekly от 4 сентября 2026 года: те же цифры (32-43% пропускной способности, четыре модели, шесть задач) и замечание, что в аннотации не указаны ни модели, ни задачи, ни метод сравнения. Аффилиации взяты из полного текста, а не со страницы abs. Ничего не заимствовано у агрегаторов и зеркал.
- Incertezze
- Это препринт без рецензирования, и все измерения — точность, пропускная способность, задержка на вытеснение — получены самими авторами: на момент проверки независимых воспроизведений не обнаружено. Оценка охватывает четыре модели (три из одного семейства Qwen3 плюс Phi-4-reasoning) и шесть задач по математике, естественным наукам и программированию, с бюджетами кэша, выбранными авторами; статья не доказывает, что вывод сохраняется для других семейств, для более жёстких бюджетов или для задач с длинным контекстом, не являющихся цепочками рассуждений, где избыточности следа, которой объясняют результат, может не быть. Преимущество по пропускной способности измерено на одной конфигурации (H200, vLLM с PagedAttention, генерации на 32 тыс. токенов). Страница GitHub не показывает явных дат создания или обновления, а анонса в официальном блоге Salesforce AI Research нет: сообщение прошло через статью и код.
- Perché pubblicarla
- Это отрицательный результат, который стоит больше многих анонсов: если он устоит, целое направление исследований оценок важности для KV-кэша окажется потраченным впустую, ведь случайный выбор даёт ту же точность впятеро дешевле за круг вытеснения. В нём есть всё, чтобы рассказать без хайпа — открытый код под Apache 2.0, явные цифры, признанные авторами ограничения — и он затрагивает конкретный вопрос для всех, кто обслуживает рассуждающие модели: сколько запросов помещается на одну GPU. Угол статьи — расстояние между силой тезиса (сигнал не нужен) и узостью проверки: четыре модели, шесть бенчмарков, все измерения собственные и ни одного внешнего повторения.
Fonti / Sources
- arXiv:2609.03430 — Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning (paper, fonte primaria)
- Testo integrale del paper (HTML arXiv)
- Repository ufficiale del codice — SalesforceAIResearch/Random-Attention (Apache 2.0)
- AI Weekly — copertura indipendente del preprint (4 settembre 2026)