AI 메모리 압축의 뜻밖의 단순함
생성 모델의 작업 기억, 이른바 KV 캐시의 관리는 추론 사슬이 길어질수록 가장 심각한 병목 가운데 하나가 되었다. 지금까지 주류 해법은 SnapKV나 TriAttention 같은 정교한 알고리즘이었다. 텍스트 조각마다 미래의 유용성 점수를 계산하고 중요하다고 판단한 정보만 남기도록 설계된 방식이다. 2026년 9월 3일 arXiv에 등록된 프리프린트(arXiv:2609.03430, Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning)는 Salesforce AI Research와 University of Illinois Urbana-Champaign 연구진의 것으로, 이 접근을 문제 삼는다. 복잡한 선택 신호는 결과의 품질에 결정적인 기여를 하지 않는다는 주장이다.
제안된 기법은 Random Attention이라 불리며 코드 저장소에 Apache 2.0 라이선스로 공개되어 있다. 관련도 계산이 아예 없는 논리를 따른다. 최초 프롬프트의 토큰과 가장 최근 구간의 토큰을 보호하고, 나머지는 각 어텐션 헤드 안에서 균일 무작위로 버린다. 논문의 논지에 따르면 추론의 흔적은 텍스트 안과 모델의 헤드들 사이에 퍼져 있는 중복 덕분에 스스로를 지킨다. Qwen3-4B의 MATH500에서 무작위 방식은 0.874, TriAttention은 0.864, SnapKV는 0.703을 기록했다. GPQA-Diamond에서는 0.530 대 0.533 — 양쪽 방향 모두 1퍼센트포인트 안팎의 차이다. 저자들이 H200 GPU와 vLLM 환경에서 보고한 측정에서, 스코어링 단계를 없애면 단계당 지연이 TriAttention의 1.47~1.64밀리초에서 0.30밀리초로 떨어진다. 3만 2천 토큰 생성에서는 전체 어텐션 대비 1.6~2.7배의 처리량이 나오고, 가장 강력한 경쟁자인 TriAttention보다 32~43% 높다.
이 연구는 동료 심사를 거치지 않았고, 정확도와 처리량과 지연을 측정한 것도 방법에 서명한 바로 그 팀이다. 제3자의 재현이나 검증은 아직 없다. 논문에 기록된 분석은 네 개의 특정 모델, 대부분 Qwen3 계열과 Phi-4-reasoning에 한정된다 — 저장소는 DeepSeek-R1-Distill-Llama-8B의 선택적 지원을 언급한다 — 그리고 프로그래밍 코드에서는 성능이 떨어진다. 프롬프트가 길어 캐시의 고정 용량을 빠르게 잡아먹기 때문이다. 시험된 예산 — 압축 약 4배, LiveCodeBench에서는 3배 — 도 저자들이 고른 것이다. 그 바깥에 대해 논문은 아무 말도 하지 않는다. 다른 모델 계열, 더 공격적인 압축, 또는 추론 사슬이 아닌 긴 텍스트 — 저자들이 무작위가 통하는 이유로 드는 흔적의 중복이 그곳에는 아예 없다. 나아가 이 방식은 드물거나 반복되지 않는 사실 앞에서 분명한 논리적 장애를 만난다. 무작위 삭제가 그런 사실을 돌이킬 수 없이 지워버릴 수 있기 때문이다.
외부 검증이 수치를 확인해 준다면, 이 결과가 다루는 것은 하나의 정확한 칸 — 모델이 추론하는 동안 캐시에서 어떤 토큰을 버릴 것인가 — 이며, 거기서는 선택의 기준보다 추론의 흔적이 스스로 만들어내는 중복이 더 무겁다는 점을 시사하게 될 것이다. — Olya
Come Olya ha verificato questa notizia
- Verificato
- arXiv의 abs/2609.03430 기록과 논문 전문을 열었다. 제목, 저자, 등록일(2026년 9월 3일), 모델, 과제, 캐시 예산, 베이스라인, 정확도 수치, 처리량, eviction 한 번당 지연, 하드웨어는 모두 거기서 나왔다. 공식 저장소 SalesforceAIResearch/Random-Attention이 Apache 2.0 라이선스, 방법 이름(random_pp), signal-free라는 설명, 지원 모델 목록을 확인해 준다. 독립적 확인으로 2026년 9월 4일 AI Weekly의 보도를 확인했고, 같은 수치(처리량 32~43%, 네 모델, 여섯 과제)를 전한다. 그 기사는 초록이 어떤 모델·어떤 과제·어떤 비교 방법인지 밝히지 않는다는 점도 지적한다. 소속은 abs 페이지가 아니라 전문에 있다. 집계 사이트나 미러에서 가져온 내용은 없다.
- Incertezze
- 동료 심사를 거치지 않은 프리프린트이며, 정확도·처리량·eviction 지연 등 모든 측정치는 저자들이 직접 낸 것이다. 확인 시점에 독립적인 재현은 확인되지 않았다. 평가는 네 모델(셋은 같은 Qwen3 계열, 여기에 Phi-4-reasoning)과 수학·과학·프로그래밍의 여섯 과제, 그리고 저자들이 고른 캐시 예산을 다룬다. 다른 모델 계열, 더 공격적인 예산, 추론 사슬이 아닌 롱컨텍스트 과제(결과를 설명하는 근거인 흔적의 중복이 없을 수 있는 영역)에서 결론이 유지된다는 증명은 논문에 없다. 처리량 우위도 특정 구성(H200, PagedAttention을 쓰는 vLLM, 32k 토큰 생성)에서의 측정이다. GitHub 페이지에는 생성일이나 최종 수정일이 표시되지 않으며, Salesforce AI Research 공식 블로그의 발표 글도 확인되지 않는다. 소통은 논문과 코드로만 이루어졌다.
- Perché pubblicarla
- 많은 발표보다 값진 부정적 결과다. 이것이 버틴다면 KV 캐시의 중요도 점수를 둘러싼 연구 한 갈래가 통째로 헛수고가 된다. 무작위 선택이 같은 정확도를 eviction 한 회당 5분의 1 비용으로 얻기 때문이다. 과장 없이 전할 재료가 다 있다 — Apache 2.0 공개 코드, 명시된 수치, 저자 스스로 인정한 한계. 그리고 추론 모델을 서비스하는 사람이면 누구나 부딪히는 구체적 질문, 즉 GPU 한 장에 요청이 몇 개나 올라가는가를 건드린다. 기사의 각도는 주장의 힘(신호는 필요 없다)과 검증의 좁음 — 네 모델, 여섯 벤치마크, 전부 자체 측정, 외부 재현 없음 — 사이의 간극이다.
Fonti / Sources
- arXiv:2609.03430 — Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning (paper, fonte primaria)
- Testo integrale del paper (HTML arXiv)
- Repository ufficiale del codice — SalesforceAIResearch/Random-Attention (Apache 2.0)
- AI Weekly — copertura indipendente del preprint (4 settembre 2026)