Oossa

llama.cpp अपडेट से Intel Arc GPU पर GLM प्रॉम्प्ट तेज़

नए SYCL बदलावों से Intel Arc Pro B70 पर टोकन प्रोसेसिंग की रफ्तार 3× तक बढ़ी और फ्लैश अटेंशन में मेमोरी ट्रैफ़िक घटा।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

llama.cpp लाइब्रेरी में जोड़े गए SYCL सपोर्ट से GLM‑4.7 फ्लैश अटेंशन तेज़ हुआ है। Intel Arc Pro B70 GPU पर 8192-टोकन कॉन्टेक्स्ट के लिए प्रॉम्प्ट प्रीफ़िल की रफ्तार 432.80 से बढ़कर 1,292.29 टोकन प्रति सेकंड हो गई—यानी लगभग तीन गुना। एक दूसरे बदलाव में, इंटरमीडिएट स्कोर को सिंगल-प्रिसीजन के बजाय हाफ-प्रिसीजन (F16) में स्टोर किया जाता है। इससे प्रोसेसिंग का समय कुछ प्रतिशत घटता है और मेमोरी का इस्तेमाल भी कम होता है। दूसरे वर्कलोड में कोई बदलाव नहीं हुआ।

यह क्यों मायने रखता है

डेवलपर किफायती Intel Arc GPU पर बड़े GLM मॉडल तेज़ी से चला सकते हैं, जिससे इंटरैक्टिव AI ऐप्स अधिक प्रतिक्रियाशील बनेंगे।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।