# تحديث llama.cpp يسرّع معالجة مطالبات GLM على Intel Arc

> تغييرات SYCL الجديدة ترفع سرعة معالجة الرموز حتى 3 أضعاف على Intel Arc Pro B70، وتقلل حركة البيانات في الذاكرة عند استخدام flash attention.

Oossa · 2026-10-07 · https://oossa.com/ar/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

أضافت مكتبة llama.cpp دعم SYCL لتسريع آلية flash attention في GLM‑4.7. وعلى وحدة معالجة الرسومات Intel Arc Pro B70، ارتفعت سرعة معالجة المطالبة المسبقة لسياق من 8192 رمزًا من 432.80 إلى 1,292.29 رمزًا في الثانية، أي أسرع بنحو ثلاثة أضعاف. ويخزّن تعديل آخر الدرجات الوسيطة بدقة نصفية (F16) بدلًا من الدقة الأحادية، ما يقلّص زمن المعالجة ببضع نقاط مئوية ويخفّض استهلاك الذاكرة. ولم تتغير نتائج أعباء العمل الأخرى.

## الحقائق

- ارتفع معدل معالجة الرموز pp8192 من 432.80 إلى 1,292.29 رمزًا في الثانية (2.99×) على Intel Arc Pro B70
- أدى تخزين درجات flash attention بدقة F16 إلى زيادة الأداء بنسبة 4.6% في pp8192 (من 1,583.9 إلى 1,657.1 رمزًا في الثانية)

## لماذا يهم

يمكن للمطورين تشغيل نماذج GLM أكبر بسرعة أعلى على وحدات Intel Arc منخفضة التكلفة، ما يجعل تطبيقات الذكاء الاصطناعي التفاعلية أكثر استجابة.

## المصادر والمراجع

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

آخر تحديث: 2026-10-07
