Araştırmacılar, bir dil modelinin anahtar-değer (KV) durumunu şifreli yerel NVMe diske kaydeden galahad‑kv adlı açık bir bellek katmanı yayımladı. Bu sayede model, 16.000 tokenlık bir bloğu yeniden hesaplamadan yükleyebiliyor. Gemma 4 12B ve 31B modelleriyle tek bir NVIDIA H100 üzerinde yapılan testlerde, 50 milyon tokenlık bir akışta yükleme 2,8‑4,3 kat daha hızlı gerçekleşti ve GPU enerji tüketimi 8,8‑12,3 kat azaldı. 31B model, metnin önceki bölümlerine ilişkin olgusal soruları yüzde 98 oranında doğru yanıtladı.
Neden önemli
Geliştiriciler, maliyet ve güç tüketimini azaltarak tek GPU üzerinde çok uzun bağlamlı uygulamalar çalıştırabiliyor.