تیم ggml-org در 2026-10-09 نسخه b11534 از llama.cpp را منتشر کرد. این بهروزرسانی کپیهای مربوط به ذخیرهٔ وضعیت را با حافظهٔ نهان بازگشتی ادغام میکند و در حالت K = 1، یعنی رمزگشایی بدون حدس، کپیهای اضافی CUDA را حذف میکند. این تغییر فقط به بکاند CUDA محدود است؛ بنابراین نسخههای CPU و Vulkan تغییری نمیکنند. فایلهای باینری ازپیشساخته برای macOS، iOS و چند نسخهٔ Ubuntu برای دانلود در دسترساند.
کاربرانی که نسخهٔ CUDA را اجرا میکنند باید شاهد کاهش اندک ترافیک حافظهٔ GPU باشند؛ این بهبود میتواند سرعت را روی سختافزارهای پشتیبانیشده افزایش دهد.
چرا مهم است
کاربران CUDA ممکن است با سریعتر شدن اجرای استنتاج روبهرو شوند، چون کتابخانه اکنون دادههای کمتری را در GPU جابهجا میکند.