Oossa

به‌روزرسانی llama.cpp سرعت پردازش پرامپت‌های GLM را روی گرافیک Intel Arc بالا برد

تغییرات جدید SYCL روی Intel Arc Pro B70 سرعت پردازش توکن‌ها را تا ۳ برابر افزایش می‌دهد و ترافیک حافظه را در فلش‌اتنشن کاهش می‌دهد.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

کتابخانه llama.cpp با افزودن پشتیبانی از SYCL، فلش‌اتنشن GLM‑4.7 را سریع‌تر کرده است. روی پردازنده گرافیکی Intel Arc Pro B70، سرعت پیش‌پردازش پرامپت برای بافت 8192 توکنی از 432.80 به 1,292.29 توکن‌برثانیه رسید؛ یعنی تقریباً سه برابر سریع‌تر. تغییر دیگری هم امتیازهای میانی را به‌جای دقت تک‌گانه، با دقت نیمه (F16) ذخیره می‌کند. این کار با کاهش مصرف حافظه، چند درصد از زمان پردازش می‌کاهد. عملکرد بارهای کاری دیگر تغییری نکرده است.

چرا مهم است

توسعه‌دهندگان می‌توانند مدل‌های بزرگ‌تر GLM را سریع‌تر روی پردازنده‌های گرافیکی مقرون‌به‌صرفه Intel Arc اجرا کنند و اپلیکیشن‌های هوش مصنوعی تعاملی‌تری بسازند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.