أصدر فريق ggml‑org الإصدار b11480 من llama.cpp في 2026‑10‑08. ويضيف التحديث ذاكرة تخزين مؤقت على GPU لوحدات MoE، موجودة في ذاكرة المضيف، ما يساعد على تشغيل النماذج الكبيرة بسرعة أكبر على وحدات GPU. ويُشار إلى أن التغيير أُنجز بمساعدة Claude، ويستخدم واجهة برمجة التطبيقات الجديدة llama_moe_cache_ptr. تتوفر للتنزيل ملفات ثنائية مسبقة البناء لأنظمة macOS وiOS وعدة إعدادات من Ubuntu.
لماذا يهم
بات بإمكان المطورين تشغيل نماذج MoE بكفاءة أكبر على وحدات GPU المخصصة للمستهلكين، ما يخفض تكلفة الأجهزة اللازمة لمشروعات الذكاء الاصطناعي.