# Un transformer si pota da solo e riduce la cache KV fino a 25 volte

> I ricercatori presentano Universal Attention, un metodo addestrabile che elimina dinamicamente i token meno rilevanti: la compressione raggiunge 10 volte nei task tipici e 25 volte con sequenze da 16k token.

Oossa · 2026-10-08 · https://oossa.com/it/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Un team guidato da Ahan Gupta ha presentato una nuova architettura chiamata Universal Attention. Mantiene gli embedding posizionali RoPE standard e l’attenzione Softmax, aggiungendo però un meccanismo di decadimento addestrabile che decide quali token eliminare durante l’inferenza. Il metodo riduce la cache key-value, la memoria usata dai grandi modelli linguistici, senza compromettere la precisione. I test mostrano una riduzione di dieci volte della cache con dati comuni e di venticinque volte nell’elaborazione di input da 16.000 token, migliorando comunque le prestazioni nelle attività successive.

## I fatti

- Compressione della cache KV di 10× nei task di linguaggio naturale
- Compressione di 25× con sequenze di 16k token

## Perché conta

Una cache più piccola consente di distribuire i grandi modelli linguistici a costi inferiori e più velocemente anche su dispositivi con memoria limitata.

## Fonti e riferimenti

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

Ultimo aggiornamento: 2026-10-08
