# Un transformer que se poda solo reduce hasta 25× la caché KV

> Investigadores presentan Universal Attention, un método entrenable que elimina de forma adaptativa los tokens de bajo impacto y logra una compresión de 10× en tareas habituales y de 25× con secuencias de 16k tokens.

Oossa · 2026-10-08 · https://oossa.com/es/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Un equipo dirigido por Ahan Gupta presentó una nueva arquitectura llamada Universal Attention. Mantiene las codificaciones posicionales RoPE estándar y la atención Softmax, pero incorpora un mecanismo de decaimiento entrenable que decide qué tokens descartar durante la inferencia. El método poda la caché de claves y valores —la memoria que utilizan los modelos de lenguaje grandes— sin perjudicar la precisión. Las pruebas muestran una reducción de diez veces en el tamaño de la caché con datos habituales y de veinticinco veces al procesar entradas de 16,000 tokens, al tiempo que mejora el rendimiento en tareas posteriores.

## Los hechos

- Compresión de 10× de la caché KV en tareas de lenguaje natural
- Compresión de 25× con una longitud de 16k tokens

## Por qué importa

Una caché más pequeña permite implementar modelos de lenguaje grandes de forma más barata y rápida en dispositivos con memoria limitada.

## Fuentes y referencias

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

Última actualización: 2026-10-08
