أصدر مشروع llama.cpp الإصدار b11474 في 2026‑10‑07. ويضيف الإصدار إلى مشغّل النماذج مخططًا للتنبؤ متعدد الرموز (MTP) في GLM5‑Next، يُسمّى NextN. ويتيح هذا التغيير تخطي العمليات الحسابية غير الضرورية عند عدم الحاجة إلى صفوف مخرجات، ما يخفض زمن اللحاق بأربعة رموز من 6.9 ms إلى 0.33 ms. كما يعالج التحديث عقود الاستخراج ويحسّن التعامل مع عمليات التراجع الجزئي في النماذج التكرارية.
لماذا يهم
يمكن للمطورين الآن تشغيل نماذج llama.cpp بسرعة أكبر، خصوصًا عند استخدام التوليد المعتمد على المسودات الذي يستفيد من التنبؤ متعدد الرموز.