أضافت مكتبة llama.cpp دعم SYCL لتسريع آلية flash attention في GLM‑4.7. وعلى وحدة معالجة الرسومات Intel Arc Pro B70، ارتفعت سرعة معالجة المطالبة المسبقة لسياق من 8192 رمزًا من 432.80 إلى 1,292.29 رمزًا في الثانية، أي أسرع بنحو ثلاثة أضعاف. ويخزّن تعديل آخر الدرجات الوسيطة بدقة نصفية (F16) بدلًا من الدقة الأحادية، ما يقلّص زمن المعالجة ببضع نقاط مئوية ويخفّض استهلاك الذاكرة. ولم تتغير نتائج أعباء العمل الأخرى.
لماذا يهم
يمكن للمطورين تشغيل نماذج GLM أكبر بسرعة أعلى على وحدات Intel Arc منخفضة التكلفة، ما يجعل تطبيقات الذكاء الاصطناعي التفاعلية أكثر استجابة.