# Kendi kendini budayan dönüştürücü KV önbelleğini 25 kata kadar küçültüyor

> Araştırmacılar, etkisi düşük tokenları uyarlamalı biçimde eleyen ve tipik görevlerde 10 kat, 16 bin tokenlık dizilerde ise 25 kat sıkıştırma sağlayan eğitilebilir Universal Attention yöntemini tanıttı.

Oossa · 2026-10-08 · https://oossa.com/tr/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Ahan Gupta liderliğindeki ekip, Universal Attention adlı yeni bir mimariyi tanıttı. Bu mimari, standart RoPE konumsal gömmelerini ve Softmax dikkat mekanizmasını korurken çıkarım sırasında hangi tokenların eleneceğine karar veren eğitilebilir bir azalma mekanizması ekliyor. Yöntem, büyük dil modellerinin kullandığı belleği, yani anahtar-değer önbelleğini, doğruluğu düşürmeden buduyor. Testler, olağan verilerde önbellek boyutunun 10 kat, 16.000 tokenlık girdiler işlenirken ise 25 kat küçüldüğünü; buna karşın sonraki aşamalardaki performansın da arttığını gösteriyor.

## Gerçekler

- Doğal dil görevlerinde KV önbelleğinde 10 kat sıkıştırma
- 16 bin token uzunluğunda 25 kat sıkıştırma

## Neden önemli

Daha küçük önbellek gereksinimi, büyük dil modellerinin belleği sınırlı cihazlarda daha düşük maliyetle ve daha hızlı çalıştırılmasını sağlar.

## Kaynaklar ve referanslar

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

Son güncelleme: 2026-10-08
