Ahan Gupta liderliğindeki ekip, Universal Attention adlı yeni bir mimariyi tanıttı. Bu mimari, standart RoPE konumsal gömmelerini ve Softmax dikkat mekanizmasını korurken çıkarım sırasında hangi tokenların eleneceğine karar veren eğitilebilir bir azalma mekanizması ekliyor. Yöntem, büyük dil modellerinin kullandığı belleği, yani anahtar-değer önbelleğini, doğruluğu düşürmeden buduyor. Testler, olağan verilerde önbellek boyutunun 10 kat, 16.000 tokenlık girdiler işlenirken ise 25 kat küçüldüğünü; buna karşın sonraki aşamalardaki performansın da arttığını gösteriyor.
Neden önemli
Daha küçük önbellek gereksinimi, büyük dil modellerinin belleği sınırlı cihazlarda daha düşük maliyetle ve daha hızlı çalıştırılmasını sağlar.