# llama.cpp अपडेट से Intel Arc GPU पर GLM प्रॉम्प्ट तेज़

> नए SYCL बदलावों से Intel Arc Pro B70 पर टोकन प्रोसेसिंग की रफ्तार 3× तक बढ़ी और फ्लैश अटेंशन में मेमोरी ट्रैफ़िक घटा।

Oossa · 2026-10-07 · https://oossa.com/hi/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

llama.cpp लाइब्रेरी में जोड़े गए SYCL सपोर्ट से GLM‑4.7 फ्लैश अटेंशन तेज़ हुआ है। Intel Arc Pro B70 GPU पर 8192-टोकन कॉन्टेक्स्ट के लिए प्रॉम्प्ट प्रीफ़िल की रफ्तार 432.80 से बढ़कर 1,292.29 टोकन प्रति सेकंड हो गई—यानी लगभग तीन गुना। एक दूसरे बदलाव में, इंटरमीडिएट स्कोर को सिंगल-प्रिसीजन के बजाय हाफ-प्रिसीजन (F16) में स्टोर किया जाता है। इससे प्रोसेसिंग का समय कुछ प्रतिशत घटता है और मेमोरी का इस्तेमाल भी कम होता है। दूसरे वर्कलोड में कोई बदलाव नहीं हुआ।

## तथ्य

- Intel Arc Pro B70 पर pp8192 की टोकन दर 432.80 से बढ़कर 1,292.29 tok/s (2.99×) हुई
- फ्लैश-अटेंशन स्कोर को F16 में स्टोर करने से pp8192 में 4.6% की बढ़त मिली (1,583.9 → 1,657.1 tok/s)

## यह क्यों मायने रखता है

डेवलपर किफायती Intel Arc GPU पर बड़े GLM मॉडल तेज़ी से चला सकते हैं, जिससे इंटरैक्टिव AI ऐप्स अधिक प्रतिक्रियाशील बनेंगे।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

अंतिम अपडेट: 2026-10-07
