# Обновление llama.cpp ускорило обработку запросов GLM на Intel Arc

> Изменения в SYCL повысили скорость обработки токенов на Intel Arc Pro B70 почти в 3 раза и сократили трафик памяти при flash attention.

Oossa · 2026-10-07 · https://oossa.com/ru/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

В библиотеке llama.cpp появилась поддержка SYCL, ускоряющая flash attention в GLM‑4.7. На видеокарте Intel Arc Pro B70 скорость предварительной обработки промпта с контекстом в 8192 токена выросла с 432.80 до 1,292.29 токена в секунду — почти втрое. Ещё одно изменение заменяет одинарную точность на половинную (F16) при хранении промежуточных оценок. Это сокращает время обработки на несколько процентов и снижает расход памяти. На других задачах изменений не было.

## Факты

- Скорость обработки промпта с контекстом в 8192 токена выросла с 432.80 до 1,292.29 токена/с (в 2.99 раза) на Intel Arc Pro B70
- Хранение оценок для flash attention в F16 ускорило обработку промпта с контекстом в 8192 токена на 4.6% (с 1,583.9 до 1,657.1 токена/с)

## Почему это важно

Разработчики смогут быстрее запускать более крупные модели GLM на доступных видеокартах Intel Arc, повышая отзывчивость интерактивных ИИ-приложений.

## Источники и ссылки

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

Обновлено: 2026-10-07
