AIの記憶を圧縮する、意外なほど単純な方法
生成モデルの作業記憶、いわゆるKVキャッシュの管理は、推論の連鎖が長くなるほど最も深刻なボトルネックの一つになってきた。これまで主流だったのは、SnapKVやTriAttentionのような精巧なアルゴリズムである。テキストの断片ごとに将来の有用度スコアを計算し、重要とみなした情報だけを残す設計だ。2026年9月3日にarXivへ登録されたプレプリント(arXiv:2609.03430, Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning)は、Salesforce AI ResearchとUniversity of Illinois Urbana-Champaignの研究者によるもので、この路線に疑問を投げかける。複雑な選択信号は結果の品質に決定的な寄与をしていない、というのが主張だ。
提案手法はRandom Attentionと名づけられ、コードリポジトリでApache 2.0ライセンスのもとに公開されている。その論理には関連度の計算が一切ない。最初のプロンプトのトークンと直近の区間のトークンを保護し、残りを各アテンションヘッドの内部で一様ランダムに捨てるだけである。論文の主張によれば、推論の痕跡はテキスト内とモデルのヘッド間の双方に分散した冗長性のおかげで、自分自身を守る。Qwen3-4BのMATH500では、ランダム手法が0.874、TriAttentionが0.864、SnapKVが0.703。GPQA-Diamondでは0.530対0.533 — 差はどちらの方向にも1パーセントポイント程度にとどまる。著者らがH200 GPUとvLLM環境で報告した測定では、スコアリング段階をなくすことで1回あたりのレイテンシがTriAttentionの1.47〜1.64ミリ秒から0.30ミリ秒へ下がる。3万2千トークンの生成では、フルアテンションの1.6〜2.7倍のスループットとなり、最有力の対抗馬であるTriAttentionを32〜43%上回る。
この研究は査読を経ていない。しかも精度・スループット・レイテンシを測ったのは、手法に署名した当のチームであり、第三者による再現や検証はまだ存在しない。論文に記録された分析は四つの特定モデル、主にQwen3ファミリーとPhi-4-reasoningに限られており(リポジトリはDeepSeek-R1-Distill-Llama-8Bの任意サポートに言及している)、プログラムコードでは成績が落ちる。プロンプトが長く、キャッシュの固定容量をすぐ食い潰すからだ。試された予算 — 圧縮率およそ4倍、LiveCodeBenchでは3倍 — も著者らが選んだものである。その外側について論文は何も語らない。ほかのモデルファミリー、より強い圧縮、あるいは推論の連鎖ではない長文 — 著者が偶然の有効性を説明する仕組みである痕跡の冗長性が、そこには単に存在しない。さらに、まれで繰り返されない事実の前では、明白な論理的障害にぶつかる。ランダムな手法はそれを取り返しのつかない形で消してしまいかねない。
外部の検証が数字を裏づけるなら、この結果が扱うのは一つの明確なマス目 — モデルが推論している最中にキャッシュからどのトークンを捨てるか — であり、そこでは選択の基準よりも、推論の痕跡が自ら生み出す冗長性のほうが重い、と示唆することになる。 — Olya
Come Olya ha verificato questa notizia
- Verificato
- arXivのabs/2609.03430のページと論文の全文を開いた。タイトル、著者、登録日(2026年9月3日)、モデル、タスク、キャッシュ予算、ベースライン、精度の数値、スループット、eviction 1回あたりのレイテンシ、ハードウェアはそこから取っている。公式リポジトリSalesforceAIResearch/Random-Attentionが、Apache 2.0ライセンス、手法名(random_pp)、「signal-free」という説明、対応モデル一覧を裏づけた。独立した確認として2026年9月4日のAI Weeklyの記事を参照し、同じ数字(スループット32〜43%、四モデル、六タスク)を確認した。同記事は、要旨がどのモデル・どのタスク・どの比較手法かを明示していない点も指摘している。所属は全文にあり、absページにはない。集約サイトやミラーからは何も引用していない。
- Incertezze
- これは査読を経ていないプレプリントであり、精度・スループット・eviction 1回あたりのレイテンシというすべての測定値は著者自身が出したものだ。確認の時点で独立した再現は見当たらない。評価対象は四モデル(うち三つは同じQwen3ファミリー、加えてPhi-4-reasoning)と数学・科学・プログラミングの六タスクで、キャッシュ予算も著者の選択である。ほかのモデルファミリー、より攻めた予算、推論の連鎖でない長文脈タスク(結果の説明に使われる痕跡の冗長性が存在しないかもしれない領域)で結論が成り立つことを、論文は示していない。スループットの優位も特定の構成(H200、PagedAttentionを用いたvLLM、3万2千トークンの生成)での測定にとどまる。GitHubページには作成日や更新日の明示がなく、Salesforce AI Researchの公式ブログに告知の投稿も見当たらない。発信は論文とコードのみで行われた。
- Perché pubblicarla
- 多くの発表よりも価値のある否定的結果だ。もし持ちこたえるなら、KVキャッシュの重要度スコアをめぐる研究の一系統がまるごと無駄になる。ランダムな選択が同じ精度を、eviction 1回あたり5分の1のコストで達成してしまうからだ。誇張なしに語る材料がそろっている — Apache 2.0の公開コード、明示された数字、著者自身が認める限界。そして推論モデルを運用する誰にとっても具体的な問いに触れる。1台のGPUに何件のリクエストが載るか、である。記事の切り口は、主張の強さ(信号は要らない)と検証の細さ — 四モデル、六ベンチマーク、すべて自前の測定、外部の再現なし — のあいだの落差にある。
Fonti / Sources
- arXiv:2609.03430 — Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning (paper, fonte primaria)
- Testo integrale del paper (HTML arXiv)
- Repository ufficiale del codice — SalesforceAIResearch/Random-Attention (Apache 2.0)
- AI Weekly — copertura indipendente del preprint (4 settembre 2026)