# Transformer verkleint KV-cache tot 25×

> Onderzoekers introduceren Universal Attention, een trainbare methode die tokens met weinig invloed automatisch verwijdert. Dat levert 10× compressie op bij gebruikelijke taken en 25× bij reeksen van 16k tokens.

Oossa · 2026-10-08 · https://oossa.com/nl/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Een team onder leiding van Ahan Gupta presenteerde een nieuwe architectuur met de naam Universal Attention. Die behoudt de gebruikelijke RoPE-positionele embeddings en Softmax-aandacht, maar voegt een trainbaar vervalmechanisme toe dat tijdens inferentie bepaalt welke tokens worden verwijderd. De methode snoeit in de key-value-cache — het geheugen dat grote taalmodellen gebruiken — zonder de nauwkeurigheid aan te tasten. Tests laten zien dat de cache tien keer kleiner wordt bij gangbare data en vijfentwintig keer kleiner bij invoer van 16.000 tokens, terwijl de prestaties op vervolgopgaven toch verbeteren.

## De feiten

- 10× compressie van de KV-cache bij taaltaken
- 25× compressie bij een lengte van 16k tokens

## Waarom het ertoe doet

Een kleinere cache maakt het goedkoper en sneller om grote taalmodellen in te zetten op apparaten met beperkt geheugen.

## Bronnen en referenties

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

Laatst bijgewerkt: 2026-10-08
