Oossa

Transformer verkleint KV-cache tot 25×

Onderzoekers introduceren Universal Attention, een trainbare methode die tokens met weinig invloed automatisch verwijdert. Dat levert 10× compressie op bij gebruikelijke taken en 25× bij reeksen van 16k tokens.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Een team onder leiding van Ahan Gupta presenteerde een nieuwe architectuur met de naam Universal Attention. Die behoudt de gebruikelijke RoPE-positionele embeddings en Softmax-aandacht, maar voegt een trainbaar vervalmechanisme toe dat tijdens inferentie bepaalt welke tokens worden verwijderd. De methode snoeit in de key-value-cache — het geheugen dat grote taalmodellen gebruiken — zonder de nauwkeurigheid aan te tasten. Tests laten zien dat de cache tien keer kleiner wordt bij gangbare data en vijfentwintig keer kleiner bij invoer van 16.000 tokens, terwijl de prestaties op vervolgopgaven toch verbeteren.

Waarom het ertoe doet

Een kleinere cache maakt het goedkoper en sneller om grote taalmodellen in te zetten op apparaten met beperkt geheugen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.