# Transformer reduziert KV-Cache selbstständig um bis zu 25×

> Forschende stellen Universal Attention vor: ein trainierbares Verfahren, das wenig relevante Tokens adaptiv entfernt. So schrumpft der Cache bei typischen Aufgaben auf ein Zehntel und bei Sequenzen mit 16k Tokens auf ein Fünfundzwanzigstel.

Oossa · 2026-10-08 · https://oossa.com/de/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Ein Team unter der Leitung von Ahan Gupta hat eine neue Architektur namens Universal Attention vorgestellt. Sie behält die standardmäßigen positionsabhängigen RoPE-Einbettungen und die Softmax-Aufmerksamkeit bei, ergänzt sie aber um einen trainierbaren Decay-Mechanismus, der während der Inferenz entscheidet, welche Tokens entfernt werden. Das Verfahren beschneidet den Key-Value-Cache – den Speicher, den große Sprachmodelle nutzen –, ohne die Genauigkeit zu beeinträchtigen. Tests zeigen, dass sich die Cache-Größe bei üblichen Daten um den Faktor zehn und bei der Verarbeitung von Eingaben mit 16.000 Tokens um den Faktor 25 verringert, während sich die Leistung bei nachgelagerten Aufgaben weiter verbessert.

## Die Fakten

- 10× KV-Cache-Komprimierung bei Aufgaben mit natürlicher Sprache
- 25× Komprimierung bei einer Sequenzlänge von 16k Tokens

## Warum es wichtig ist

Ein kleinerer Cache ermöglicht den günstigeren und schnelleren Einsatz großer Sprachmodelle auf Geräten mit begrenztem Speicher.

## Quellen und Referenzen

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

Zuletzt aktualisiert: 2026-10-08
