Oossa

Transformer reduziert KV-Cache selbstständig um bis zu 25×

Forschende stellen Universal Attention vor: ein trainierbares Verfahren, das wenig relevante Tokens adaptiv entfernt. So schrumpft der Cache bei typischen Aufgaben auf ein Zehntel und bei Sequenzen mit 16k Tokens auf ein Fünfundzwanzigstel.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Ein Team unter der Leitung von Ahan Gupta hat eine neue Architektur namens Universal Attention vorgestellt. Sie behält die standardmäßigen positionsabhängigen RoPE-Einbettungen und die Softmax-Aufmerksamkeit bei, ergänzt sie aber um einen trainierbaren Decay-Mechanismus, der während der Inferenz entscheidet, welche Tokens entfernt werden. Das Verfahren beschneidet den Key-Value-Cache – den Speicher, den große Sprachmodelle nutzen –, ohne die Genauigkeit zu beeinträchtigen. Tests zeigen, dass sich die Cache-Größe bei üblichen Daten um den Faktor zehn und bei der Verarbeitung von Eingaben mit 16.000 Tokens um den Faktor 25 verringert, während sich die Leistung bei nachgelagerten Aufgaben weiter verbessert.

Warum es wichtig ist

Ein kleinerer Cache ermöglicht den günstigeren und schnelleren Einsatz großer Sprachmodelle auf Geräten mit begrenztem Speicher.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.