أصدر فريق ggml‑org الإصدار b11507 من llama.cpp في October 8, 2026. ويضيف التحديث دعمًا لذاكرة تخزين مؤقت لمزيج الخبراء (MoE) يمكن توزيعها على عدة وحدات GPU. وهذا يتيح للمطورين تشغيل نماذج MoE أكبر من دون الحاجة إلى وضع كل شيء على بطاقة واحدة. ويتضمن الإصدار أيضًا حزمًا ثنائية جديدة لأنظمة macOS وiOS وعدة إعدادات من Linux، بما فيها دعم CUDA 12.8.
لماذا يهم
بات بإمكان المطورين تشغيل نماذج ذكاء اصطناعي أكبر وأكثر قدرة على أجهزة تضم عدة وحدات GPU، ما يوسع إمكانات الأجهزة الشخصية.