# به‌روزرسانی llama.cpp سرعت پردازش پرامپت‌های GLM را روی گرافیک Intel Arc بالا برد

> تغییرات جدید SYCL روی Intel Arc Pro B70 سرعت پردازش توکن‌ها را تا ۳ برابر افزایش می‌دهد و ترافیک حافظه را در فلش‌اتنشن کاهش می‌دهد.

Oossa · 2026-10-07 · https://oossa.com/fa/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

کتابخانه llama.cpp با افزودن پشتیبانی از SYCL، فلش‌اتنشن GLM‑4.7 را سریع‌تر کرده است. روی پردازنده گرافیکی Intel Arc Pro B70، سرعت پیش‌پردازش پرامپت برای بافت 8192 توکنی از 432.80 به 1,292.29 توکن‌برثانیه رسید؛ یعنی تقریباً سه برابر سریع‌تر. تغییر دیگری هم امتیازهای میانی را به‌جای دقت تک‌گانه، با دقت نیمه (F16) ذخیره می‌کند. این کار با کاهش مصرف حافظه، چند درصد از زمان پردازش می‌کاهد. عملکرد بارهای کاری دیگر تغییری نکرده است.

## حقایق

- سرعت پردازش pp8192 روی Intel Arc Pro B70 از 432.80 به 1,292.29 توکن‌برثانیه رسید (۲٫۹۹ برابر).
- ذخیره امتیازهای فلش‌اتنشن با فرمت F16 برای pp8192 سرعت را ۴٫۶٪ افزایش داد (از 1,583.9 به 1,657.1 توکن‌برثانیه).

## چرا مهم است

توسعه‌دهندگان می‌توانند مدل‌های بزرگ‌تر GLM را سریع‌تر روی پردازنده‌های گرافیکی مقرون‌به‌صرفه Intel Arc اجرا کنند و اپلیکیشن‌های هوش مصنوعی تعاملی‌تری بسازند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

آخرین به‌روزرسانی: 2026-10-07
