# llama.cpp با پیش‌بینی چندتوکنی GLM5‑Next سریع‌تر شد

> اجراکننده متن‌باز مدل‌های زبانی بزرگ حالا از سرِ MTP جدید GLM5‑Next پشتیبانی می‌کند و زمان جبران عقب‌ماندگی 4 توکن را به 0.33 ms می‌رساند.

Oossa · 2026-10-07 · https://oossa.com/fa/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

پروژه llama.cpp نسخه b11474 را در 2026‑10‑07 منتشر کرد. این نسخه گراف پیش‌بینی چندتوکنی (MTP) با نام NextN را برای GLM5‑Next به اجراکننده مدل اضافه می‌کند. این تغییر باعث می‌شود کد در نبود ردیف‌های خروجیِ موردنیاز، محاسبات غیرضروری را انجام ندهد و تأخیر جبران عقب‌ماندگی 4 توکن را از 6.9 ms به 0.33 ms کاهش دهد. این به‌روزرسانی همچنین قراردادهای استخراج را اصلاح می‌کند و نحوه مدیریت بازگشت‌های جزئی در مدل‌های بازگشتی را بهبود می‌بخشد.

## حقایق

- نسخه b11474 در 2026‑10‑07 منتشر شد («Wed Oct 07 2026 15:42:20 GMT+0200»)
- تأخیر جبران عقب‌ماندگی 4 توکن از 6.9 ms به 0.33 ms کاهش یافت

## چرا مهم است

توسعه‌دهندگان حالا می‌توانند مدل‌های llama.cpp را سریع‌تر اجرا کنند؛ به‌ویژه هنگام استفاده از تولید مبتنی بر توکن‌های پیشنهادی که به پیش‌بینی چندتوکنی متکی است.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

آخرین به‌روزرسانی: 2026-10-07
