Ein Team unter der Leitung von Ahan Gupta hat eine neue Architektur namens Universal Attention vorgestellt. Sie behält die standardmäßigen positionsabhängigen RoPE-Einbettungen und die Softmax-Aufmerksamkeit bei, ergänzt sie aber um einen trainierbaren Decay-Mechanismus, der während der Inferenz entscheidet, welche Tokens entfernt werden. Das Verfahren beschneidet den Key-Value-Cache – den Speicher, den große Sprachmodelle nutzen –, ohne die Genauigkeit zu beeinträchtigen. Tests zeigen, dass sich die Cache-Größe bei üblichen Daten um den Faktor zehn und bei der Verarbeitung von Eingaben mit 16.000 Tokens um den Faktor 25 verringert, während sich die Leistung bei nachgelagerten Aufgaben weiter verbessert.
Warum es wichtig ist
Ein kleinerer Cache ermöglicht den günstigeren und schnelleren Einsatz großer Sprachmodelle auf Geräten mit begrenztem Speicher.