کتابخانه llama.cpp با افزودن پشتیبانی از SYCL، فلشاتنشن GLM‑4.7 را سریعتر کرده است. روی پردازنده گرافیکی Intel Arc Pro B70، سرعت پیشپردازش پرامپت برای بافت 8192 توکنی از 432.80 به 1,292.29 توکنبرثانیه رسید؛ یعنی تقریباً سه برابر سریعتر. تغییر دیگری هم امتیازهای میانی را بهجای دقت تکگانه، با دقت نیمه (F16) ذخیره میکند. این کار با کاهش مصرف حافظه، چند درصد از زمان پردازش میکاهد. عملکرد بارهای کاری دیگر تغییری نکرده است.
چرا مهم است
توسعهدهندگان میتوانند مدلهای بزرگتر GLM را سریعتر روی پردازندههای گرافیکی مقرونبهصرفه Intel Arc اجرا کنند و اپلیکیشنهای هوش مصنوعی تعاملیتری بسازند.