llama.cpp projesi, 2026‑10‑05’te b11430 sürümünü yayımladı. Bu sürüm, KV başlıklarının sayısı çekirdek sayısına kalansız bölündüğünde her çekirdeğin attention başlıklarının yalnızca bir alt kümesini işlemesini sağlayan GGML_HEXAGON_FA_HEAD_SPLIT adlı bir bayrak ekliyor. Böylece her çekirdeğin okuması gereken KV önbelleği miktarı azalıyor ve bellek bant genişliği daha verimli kullanılıyor. Dört çekirdekte yapılan testlerde Qwen3‑0.6B’de hız %58, llama‑3.2‑3B’de ise %49 arttı. Bu özellik isteğe bağlı; run.py’deki yeni –fa-head-split seçeneğiyle etkinleştiriliyor.
Neden önemli
llama.cpp’yi Qualcomm Hexagon donanımında çalıştıran geliştiriciler, kodlarında değişiklik yapmadan desteklenen modellerde gözle görülür ölçüde daha hızlı çıkarım elde edebilir.