Ett team lett av Ahan Gupta presenterade en ny arkitektur som kallas Universal Attention. Den behåller standardens RoPE-positionsembäddningar och Softmax-attention, men lägger till en träningsbar mekanism för avklingning som avgör vilka token som ska tas bort under inferens. Metoden gallrar i nyckel-värde-cachen – minnet som stora språkmodeller använder – utan att försämra träffsäkerheten. Tester visar att cachestorleken minskar tio gånger för vanliga data och tjugofem gånger vid bearbetning av indata med 16 000 token, samtidigt som prestandan i efterföljande uppgifter förbättras.
Varför det spelar roll
En mindre cache gör det billigare och snabbare att köra stora språkmodeller på enheter med begränsat minne.