# llama.cpp, MoE uzmanları için GPU önbelleği ekledi

> Açık kaynaklı llama.cpp kütüphanesi, Uzman Karışımı (MoE) verilerini artık ana bellekte tutulan bir GPU önbelleğinde saklıyor.

Oossa · 2026-10-08 · https://oossa.com/tr/llama-cpp-adds-gpu-cache-for-moe-experts

ggml‑org ekibi, llama.cpp’nin b11480 sürümünü 2026‑10‑08 tarihinde yayımladı. Güncelleme, ana bellekte çalışan ve büyük modellerin GPU’larda daha hızlı çalışmasına yardımcı olan bir MoE uzmanları GPU önbelleği ekliyor. Değişiklikte Claude’un katkısı olduğu belirtiliyor ve yeni llama_moe_cache_ptr API’si kullanılıyor. macOS, iOS ve çeşitli Ubuntu yapılandırmaları için önceden derlenmiş ikili dosyalar indirilebiliyor.

## Gerçekler

- Sürüm: b11480
- Yayın tarihi: 2026‑10‑08

## Neden önemli

Geliştiriciler artık MoE modellerini tüketici GPU’larında daha verimli çalıştırabilir; böylece yapay zekâ projeleri için gereken donanım maliyeti düşer.

## Kaynaklar ve referanslar

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

Son güncelleme: 2026-10-08
