Oossa

llama.cpp में GLM5‑Next MTP और तेज़ प्रदर्शन के सुधार

ओपन-सोर्स LLM रनर में अब नया GLM5‑Next MTP हेड है, जिससे 4‑टोकन कैच-अप का समय घटकर 0.33 ms रह गया है।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

llama.cpp प्रोजेक्ट ने 2026‑10‑07 को संस्करण b11474 जारी किया। इसमें मॉडल रनर के लिए NextN नाम का GLM5‑Next मल्टी-टोकन प्रेडिक्शन (MTP) ग्राफ़ जोड़ा गया है। इस बदलाव से, जब आउटपुट रो की ज़रूरत नहीं होती, तो कोड अनावश्यक गणना छोड़ सकता है। इससे 4‑टोकन कैच-अप की लेटेंसी 6.9 ms से घटकर 0.33 ms रह गई है। अपडेट में एक्सट्रैक्शन कॉन्ट्रैक्ट भी ठीक किए गए हैं और आंशिक रिकरेंट रोलबैक को संभालने का तरीका बेहतर बनाया गया है।

यह क्यों मायने रखता है

डेवलपर अब llama.cpp मॉडल तेज़ी से चला सकते हैं, खासकर ड्राफ्ट-आधारित जनरेशन में, जो मल्टी-टोकन प्रेडिक्शन पर निर्भर करता है।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।