# llama.cpp में GLM5‑Next MTP और तेज़ प्रदर्शन के सुधार

> ओपन-सोर्स LLM रनर में अब नया GLM5‑Next MTP हेड है, जिससे 4‑टोकन कैच-अप का समय घटकर 0.33 ms रह गया है।

Oossa · 2026-10-07 · https://oossa.com/hi/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

llama.cpp प्रोजेक्ट ने 2026‑10‑07 को संस्करण b11474 जारी किया। इसमें मॉडल रनर के लिए NextN नाम का GLM5‑Next मल्टी-टोकन प्रेडिक्शन (MTP) ग्राफ़ जोड़ा गया है। इस बदलाव से, जब आउटपुट रो की ज़रूरत नहीं होती, तो कोड अनावश्यक गणना छोड़ सकता है। इससे 4‑टोकन कैच-अप की लेटेंसी 6.9 ms से घटकर 0.33 ms रह गई है। अपडेट में एक्सट्रैक्शन कॉन्ट्रैक्ट भी ठीक किए गए हैं और आंशिक रिकरेंट रोलबैक को संभालने का तरीका बेहतर बनाया गया है।

## तथ्य

- संस्करण b11474 2026‑10‑07 को जारी हुआ ("Wed Oct 07 2026 15:42:20 GMT+0200")
- 4‑टोकन कैच-अप की लेटेंसी 6.9 ms से घटकर 0.33 ms हुई

## यह क्यों मायने रखता है

डेवलपर अब llama.cpp मॉडल तेज़ी से चला सकते हैं, खासकर ड्राफ्ट-आधारित जनरेशन में, जो मल्टी-टोकन प्रेडिक्शन पर निर्भर करता है।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

अंतिम अपडेट: 2026-10-07
