Un team guidato da Ahan Gupta ha presentato una nuova architettura chiamata Universal Attention. Mantiene gli embedding posizionali RoPE standard e l’attenzione Softmax, aggiungendo però un meccanismo di decadimento addestrabile che decide quali token eliminare durante l’inferenza. Il metodo riduce la cache key-value, la memoria usata dai grandi modelli linguistici, senza compromettere la precisione. I test mostrano una riduzione di dieci volte della cache con dati comuni e di venticinque volte nell’elaborazione di input da 16.000 token, migliorando comunque le prestazioni nelle attività successive.
Perché conta
Una cache più piccola consente di distribuire i grandi modelli linguistici a costi inferiori e più velocemente anche su dispositivi con memoria limitata.