# Bellek katmanı, 50 milyon tokenlık bağlamı daha hızlı ve ucuza işliyor

> galahad‑kv paketi KV durumunu şifreli NVMe’de saklıyor; uzun metinlerde hesaplama süresini 2,8‑4,3 kat, enerji tüketimini 8,8‑12,3 kat azaltıyor.

Oossa · 2026-10-09 · https://oossa.com/tr/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

Araştırmacılar, bir dil modelinin anahtar-değer (KV) durumunu şifreli yerel NVMe diske kaydeden galahad‑kv adlı açık bir bellek katmanı yayımladı. Bu sayede model, 16.000 tokenlık bir bloğu yeniden hesaplamadan yükleyebiliyor. Gemma 4 12B ve 31B modelleriyle tek bir NVIDIA H100 üzerinde yapılan testlerde, 50 milyon tokenlık bir akışta yükleme 2,8‑4,3 kat daha hızlı gerçekleşti ve GPU enerji tüketimi 8,8‑12,3 kat azaldı. 31B model, metnin önceki bölümlerine ilişkin olgusal soruları yüzde 98 oranında doğru yanıtladı.

## Gerçekler

- Bellek katmanı, 16.000 tokenlık blokların KV durumunu şifreli NVMe’de saklıyor.
- Bir bloğun yüklenmesi 2,8‑4,3 kat daha hızlı gerçekleşti ve GPU enerji tüketimi 8,8‑12,3 kat azaldı.

## Neden önemli

Geliştiriciler, maliyet ve güç tüketimini azaltarak tek GPU üzerinde çok uzun bağlamlı uygulamalar çalıştırabiliyor.

## Kaynaklar ve referanslar

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

Son güncelleme: 2026-10-09
