llama.cpp लाइब्रेरी में जोड़े गए SYCL सपोर्ट से GLM‑4.7 फ्लैश अटेंशन तेज़ हुआ है। Intel Arc Pro B70 GPU पर 8192-टोकन कॉन्टेक्स्ट के लिए प्रॉम्प्ट प्रीफ़िल की रफ्तार 432.80 से बढ़कर 1,292.29 टोकन प्रति सेकंड हो गई—यानी लगभग तीन गुना। एक दूसरे बदलाव में, इंटरमीडिएट स्कोर को सिंगल-प्रिसीजन के बजाय हाफ-प्रिसीजन (F16) में स्टोर किया जाता है। इससे प्रोसेसिंग का समय कुछ प्रतिशत घटता है और मेमोरी का इस्तेमाल भी कम होता है। दूसरे वर्कलोड में कोई बदलाव नहीं हुआ।
यह क्यों मायने रखता है
डेवलपर किफायती Intel Arc GPU पर बड़े GLM मॉडल तेज़ी से चला सकते हैं, जिससे इंटरैक्टिव AI ऐप्स अधिक प्रतिक्रियाशील बनेंगे।