llama.cpp projesi, b11482 sürümünü 8 Ekim 2026’da yayımladı. Sürüm, 512’nin üzerindeki blok genişliklerinde çalışan CUDA FWHT çekirdekleri ekleyerek hem FP32 hem de FP16 veriler için desteği 1.024-8.192 aralığına taşıyor. Değişiklik, mevcut F16 altyapısını yeniden kullanıyor ve A10 GPU’da testleri başarıyla geçiyor. Mevcut warp genişlikleri (64-512) için kullanılan çekirdeklerde değişiklik yapılmadı.
Neden önemli
GPU kullanıcıları artık llama.cpp ile daha genişlikli matris çarpımlarını daha hızlı çalıştırabiliyor.