# Självbeskärande transformer minskar KV-cachen upp till 25 gånger

> Forskare presenterar Universal Attention, en träningsbar metod som anpassar vilka mindre betydelsefulla token som tas bort. Den komprimerar cachen 10 gånger vid vanliga uppgifter och 25 gånger för sekvenser med 16k token.

Oossa · 2026-10-08 · https://oossa.com/sv/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Ett team lett av Ahan Gupta presenterade en ny arkitektur som kallas Universal Attention. Den behåller standardens RoPE-positionsembäddningar och Softmax-attention, men lägger till en träningsbar mekanism för avklingning som avgör vilka token som ska tas bort under inferens. Metoden gallrar i nyckel-värde-cachen – minnet som stora språkmodeller använder – utan att försämra träffsäkerheten. Tester visar att cachestorleken minskar tio gånger för vanliga data och tjugofem gånger vid bearbetning av indata med 16 000 token, samtidigt som prestandan i efterföljande uppgifter förbättras.

## Fakta

- 10× komprimering av KV-cachen vid språkbehandlingsuppgifter
- 25× komprimering vid en sekvenslängd på 16k token

## Varför det spelar roll

En mindre cache gör det billigare och snabbare att köra stora språkmodeller på enheter med begränsat minne.

## Källor och referenser

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

Senast uppdaterad: 2026-10-08
