Een team onder leiding van Ahan Gupta presenteerde een nieuwe architectuur met de naam Universal Attention. Die behoudt de gebruikelijke RoPE-positionele embeddings en Softmax-aandacht, maar voegt een trainbaar vervalmechanisme toe dat tijdens inferentie bepaalt welke tokens worden verwijderd. De methode snoeit in de key-value-cache — het geheugen dat grote taalmodellen gebruiken — zonder de nauwkeurigheid aan te tasten. Tests laten zien dat de cache tien keer kleiner wordt bij gangbare data en vijfentwintig keer kleiner bij invoer van 16.000 tokens, terwijl de prestaties op vervolgopgaven toch verbeteren.
Waarom het ertoe doet
Een kleinere cache maakt het goedkoper en sneller om grote taalmodellen in te zetten op apparaten met beperkt geheugen.