Oossa

Kendi kendini budayan dönüştürücü KV önbelleğini 25 kata kadar küçültüyor

Araştırmacılar, etkisi düşük tokenları uyarlamalı biçimde eleyen ve tipik görevlerde 10 kat, 16 bin tokenlık dizilerde ise 25 kat sıkıştırma sağlayan eğitilebilir Universal Attention yöntemini tanıttı.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

Ahan Gupta liderliğindeki ekip, Universal Attention adlı yeni bir mimariyi tanıttı. Bu mimari, standart RoPE konumsal gömmelerini ve Softmax dikkat mekanizmasını korurken çıkarım sırasında hangi tokenların eleneceğine karar veren eğitilebilir bir azalma mekanizması ekliyor. Yöntem, büyük dil modellerinin kullandığı belleği, yani anahtar-değer önbelleğini, doğruluğu düşürmeden buduyor. Testler, olağan verilerde önbellek boyutunun 10 kat, 16.000 tokenlık girdiler işlenirken ise 25 kat küçüldüğünü; buna karşın sonraki aşamalardaki performansın da arttığını gösteriyor.

Neden önemli

Daha küçük önbellek gereksinimi, büyük dil modellerinin belleği sınırlı cihazlarda daha düşük maliyetle ve daha hızlı çalıştırılmasını sağlar.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.