Oossa

Un transformer si pota da solo e riduce la cache KV fino a 25 volte

I ricercatori presentano Universal Attention, un metodo addestrabile che elimina dinamicamente i token meno rilevanti: la compressione raggiunge 10 volte nei task tipici e 25 volte con sequenze da 16k token.

BreveDi Pubblicato da Oossa: 1 min di lettura

Un team guidato da Ahan Gupta ha presentato una nuova architettura chiamata Universal Attention. Mantiene gli embedding posizionali RoPE standard e l’attenzione Softmax, aggiungendo però un meccanismo di decadimento addestrabile che decide quali token eliminare durante l’inferenza. Il metodo riduce la cache key-value, la memoria usata dai grandi modelli linguistici, senza compromettere la precisione. I test mostrano una riduzione di dieci volte della cache con dati comuni e di venticinque volte nell’elaborazione di input da 16.000 token, migliorando comunque le prestazioni nelle attività successive.

Perché conta

Una cache più piccola consente di distribuire i grandi modelli linguistici a costi inferiori e più velocemente anche su dispositivi con memoria limitata.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.