La sorprendente sencillez de comprimir la memoria de la IA
La gestión de la memoria de trabajo en los modelos generativos, la llamada caché KV, se ha convertido en uno de los cuellos de botella más críticos cuando las cadenas de razonamiento se alargan. Hasta ahora la solución dominante han sido algoritmos sofisticados, como SnapKV o TriAttention, diseñados para calcular una puntuación de utilidad futura para cada fragmento de texto y conservar solo lo que se considera crucial. Un preprint depositado en arXiv el 3 de septiembre de 2026 (arXiv:2609.03430, Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning), firmado por investigadores de Salesforce AI Research y de la University of Illinois Urbana-Champaign, pone en duda ese planteamiento: las señales de selección complejas, sostiene, no aportan nada determinante a la calidad del resultado.
La técnica propuesta, llamada Random Attention y publicada con licencia Apache 2.0 en su repositorio de código, adopta una lógica sin cálculo alguno de pertinencia: protege los tokens del prompt inicial y los de la ventana más reciente, y descarta el resto de forma uniformemente aleatoria dentro de cada cabeza de atención. Según la tesis del artículo, las trazas de razonamiento se protegen solas gracias a una redundancia repartida tanto en el texto como entre las cabezas del modelo. En MATH500 con Qwen3-4B el método aleatorio marca 0,874 frente al 0,864 de TriAttention y al 0,703 de SnapKV; en GPQA-Diamond, 0,530 frente a 0,533 — diferencias del orden del punto porcentual, en ambas direcciones. En las mediciones que reportan los autores sobre una GPU H200 con vLLM, suprimir la fase de scoring reduce la latencia del paso de los 1,47-1,64 milisegundos de TriAttention a 0,30 milisegundos. En generaciones de 32 mil tokens, eso produce un rendimiento de entre 1,6 y 2,7 veces el de la atención completa, y un 32-43% superior al de TriAttention, el competidor más fuerte.
El trabajo no ha pasado por revisión por pares, y es el propio equipo que firma el método quien ha medido su precisión, su rendimiento y su latencia, sin que existan todavía reproducciones ni verificaciones independientes de terceros. El análisis documentado se limita además a cuatro modelos concretos, en su mayoría de la familia Qwen3 más Phi-4-reasoning — mientras el repositorio menciona soporte opcional para DeepSeek-R1-Distill-Llama-8B — y muestra caídas en el código informático, donde la longitud de los prompts agota rápidamente la capacidad fija de la caché. Los presupuestos probados — unas 4 veces de compresión, 3 en LiveCodeBench — los eligieron los autores. Fuera de ese perímetro el artículo no dice nada: otras familias de modelos, compresiones más agresivas, o textos largos que no sean cadenas de razonamiento, donde la redundancia de la traza — el mecanismo con el que los autores explican por qué funciona el azar — sencillamente no está. El sistema encuentra además un obstáculo lógico evidente ante hechos raros o sin repetición, que el método aleatorio corre el riesgo de eliminar sin remedio.
Si las verificaciones externas confirman las cifras, el resultado afectará a una casilla precisa — qué token tirar de la caché mientras un modelo razona — y sugerirá que ahí el criterio de elección pesa menos que la redundancia que la propia traza de razonamiento produce por sí sola. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Abrí en arXiv la ficha abs/2609.03430 y el texto completo del artículo: de ahí salen el título, los autores, la fecha de depósito (3 de septiembre de 2026), los modelos, las tareas, los presupuestos de caché, las líneas base, las cifras de precisión, el rendimiento, la latencia por eviction y el hardware. El repositorio oficial SalesforceAIResearch/Random-Attention confirma la licencia Apache 2.0, el nombre del método (random_pp), la descripción «signal-free» y la lista de modelos soportados. Como confirmación independiente verifiqué la cobertura de AI Weekly del 4 de septiembre de 2026, que da las mismas cifras (32-43% de rendimiento, cuatro modelos, seis tareas) y añade que el resumen no especifica qué modelos, qué tareas ni qué método de comparación. Las afiliaciones están en el texto completo, no en la página abs. Nada tomado de agregadores ni de réplicas.
- Incertezze
- Es un preprint, no un trabajo revisado por pares, y todas las medidas — precisión, rendimiento, latencia por eviction — las produjeron los propios autores: en el momento de la verificación no constaban reproducciones independientes. La evaluación cubre cuatro modelos (tres de la misma familia Qwen3, más Phi-4-reasoning) y seis tareas de matemáticas, ciencias y programación, con presupuestos de caché elegidos por los autores; el artículo no demuestra que la conclusión se sostenga en otras familias, con presupuestos más agresivos o en tareas de contexto largo que no sean cadenas de razonamiento, donde la redundancia de la traza que se invoca para explicar el resultado podría no existir. La ventaja de rendimiento se mide en una configuración concreta (H200, vLLM con PagedAttention, generaciones de 32k tokens). La página de GitHub no muestra fechas explícitas de creación ni de última actualización, y no consta ningún anuncio en el blog oficial de Salesforce AI Research: la comunicación fue por artículo y código.
- Perché pubblicarla
- Es un resultado negativo que vale más que muchos anuncios: si aguanta, toda una línea de investigación sobre puntuaciones de importancia para la caché KV se convierte en trabajo tirado, porque una elección aleatoria logra la misma precisión costando cinco veces menos por ronda de eviction. Tiene todo lo necesario para contarse sin hype — código abierto Apache 2.0, cifras explícitas, límites admitidos por los autores — y toca un punto concreto para quien sirve modelos de razonamiento: cuántas peticiones caben en una GPU. El enfoque del artículo es la distancia entre la fuerza de la tesis (la señal no hace falta) y la estrechez de la verificación: cuatro modelos, seis benchmarks, mediciones todas en casa y ninguna réplica externa.
Fonti / Sources
- arXiv:2609.03430 — Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning (paper, fonte primaria)
- Testo integrale del paper (HTML arXiv)
- Repository ufficiale del codice — SalesforceAIResearch/Random-Attention (Apache 2.0)
- AI Weekly — copertura indipendente del preprint (4 settembre 2026)