Oossa

Självbeskärande transformer minskar KV-cachen upp till 25 gånger

Forskare presenterar Universal Attention, en träningsbar metod som anpassar vilka mindre betydelsefulla token som tas bort. Den komprimerar cachen 10 gånger vid vanliga uppgifter och 25 gånger för sekvenser med 16k token.

NotisAv Publicerad av Oossa: 1 min läsning

Ett team lett av Ahan Gupta presenterade en ny arkitektur som kallas Universal Attention. Den behåller standardens RoPE-positionsembäddningar och Softmax-attention, men lägger till en träningsbar mekanism för avklingning som avgör vilka token som ska tas bort under inferens. Metoden gallrar i nyckel-värde-cachen – minnet som stora språkmodeller använder – utan att försämra träffsäkerheten. Tester visar att cachestorleken minskar tio gånger för vanliga data och tjugofem gånger vid bearbetning av indata med 16 000 token, samtidigt som prestandan i efterföljande uppgifter förbättras.

Varför det spelar roll

En mindre cache gör det billigare och snabbare att köra stora språkmodeller på enheter med begränsat minne.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.