أصدر فريق ggml‑org الإصدار b11534 من llama.cpp في 2026-10-09. يدمج التحديث عمليات نسخ لقطات الحالة في الذاكرة المؤقتة المتكررة، ويلغي عمليات نسخ إضافية عبر CUDA عندما تكون K = 1، وهي حالة فك ترميز غير استدلالي تكهني. يقتصر التغيير على الواجهة الخلفية لـ CUDA، لذا لا تتغير إصدارات CPU وVulkan. تتوفر للتنزيل ملفات ثنائية مُعدّة مسبقًا لأنظمة macOS وiOS وعدة إصدارات من Ubuntu.
ينبغي أن يلاحظ مستخدمو إصدار CUDA انخفاضًا طفيفًا في حركة بيانات ذاكرة GPU، ما قد يحسّن السرعة على الأجهزة المدعومة.
لماذا يهم
قد يحصل مستخدمو CUDA على استدلال أسرع لأن المكتبة تنقل بيانات أقل على GPU.