Oossa

تحديث llama.cpp يسرّع معالجة مطالبات GLM على Intel Arc

تغييرات SYCL الجديدة ترفع سرعة معالجة الرموز حتى 3 أضعاف على Intel Arc Pro B70، وتقلل حركة البيانات في الذاكرة عند استخدام flash attention.

خبر موجزبقلم نشرته Oossa: 1 دقائق قراءة

أضافت مكتبة llama.cpp دعم SYCL لتسريع آلية flash attention في GLM‑4.7. وعلى وحدة معالجة الرسومات Intel Arc Pro B70، ارتفعت سرعة معالجة المطالبة المسبقة لسياق من 8192 رمزًا من 432.80 إلى 1,292.29 رمزًا في الثانية، أي أسرع بنحو ثلاثة أضعاف. ويخزّن تعديل آخر الدرجات الوسيطة بدقة نصفية (F16) بدلًا من الدقة الأحادية، ما يقلّص زمن المعالجة ببضع نقاط مئوية ويخفّض استهلاك الذاكرة. ولم تتغير نتائج أعباء العمل الأخرى.

لماذا يهم

يمكن للمطورين تشغيل نماذج GLM أكبر بسرعة أعلى على وحدات Intel Arc منخفضة التكلفة، ما يجعل تطبيقات الذكاء الاصطناعي التفاعلية أكثر استجابة.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.