تیم ggml‑org نسخه b11499 از llama.cpp را در 8 اکتبر 2026 منتشر کرد. در این بهروزرسانی، backend مربوط به CUDA برای عملیات roll از فاصلهٔ بایتی استفاده میکند و به GPU امکان میدهد دادههای غیرپیوسته را درست پردازش کند. این نسخه همچنین باینریهای تازهای برای Apple Silicon، مکهای مجهز به پردازندهٔ Intel، iOS و چند نسخهٔ Ubuntu (برای CPU، Vulkan و CUDA 12) ارائه میکند. همهٔ فایلها از صفحهٔ انتشار در GitHub قابل دانلود هستند.
چرا مهم است
توسعهدهندگان میتوانند llama.cpp را بدون خطا روی مجموعهٔ گستردهتری از پیکربندیهای GPU اجرا کنند و استفاده از مدلهای زبانی بزرگ بهصورت محلی را روی رایانههای رومیزی و سرورها گسترش دهند.