llama.cpp प्रोजेक्ट ने 2026‑10‑07 को संस्करण b11474 जारी किया। इसमें मॉडल रनर के लिए NextN नाम का GLM5‑Next मल्टी-टोकन प्रेडिक्शन (MTP) ग्राफ़ जोड़ा गया है। इस बदलाव से, जब आउटपुट रो की ज़रूरत नहीं होती, तो कोड अनावश्यक गणना छोड़ सकता है। इससे 4‑टोकन कैच-अप की लेटेंसी 6.9 ms से घटकर 0.33 ms रह गई है। अपडेट में एक्सट्रैक्शन कॉन्ट्रैक्ट भी ठीक किए गए हैं और आंशिक रिकरेंट रोलबैक को संभालने का तरीका बेहतर बनाया गया है।
यह क्यों मायने रखता है
डेवलपर अब llama.cpp मॉडल तेज़ी से चला सकते हैं, खासकर ड्राफ्ट-आधारित जनरेशन में, जो मल्टी-टोकन प्रेडिक्शन पर निर्भर करता है।