پروژه llama.cpp نسخه b11474 را در 2026‑10‑07 منتشر کرد. این نسخه گراف پیشبینی چندتوکنی (MTP) با نام NextN را برای GLM5‑Next به اجراکننده مدل اضافه میکند. این تغییر باعث میشود کد در نبود ردیفهای خروجیِ موردنیاز، محاسبات غیرضروری را انجام ندهد و تأخیر جبران عقبماندگی 4 توکن را از 6.9 ms به 0.33 ms کاهش دهد. این بهروزرسانی همچنین قراردادهای استخراج را اصلاح میکند و نحوه مدیریت بازگشتهای جزئی در مدلهای بازگشتی را بهبود میبخشد.
چرا مهم است
توسعهدهندگان حالا میتوانند مدلهای llama.cpp را سریعتر اجرا کنند؛ بهویژه هنگام استفاده از تولید مبتنی بر توکنهای پیشنهادی که به پیشبینی چندتوکنی متکی است.