Oossa

Обновление llama.cpp ускорило обработку запросов GLM на Intel Arc

Изменения в SYCL повысили скорость обработки токенов на Intel Arc Pro B70 почти в 3 раза и сократили трафик памяти при flash attention.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

В библиотеке llama.cpp появилась поддержка SYCL, ускоряющая flash attention в GLM‑4.7. На видеокарте Intel Arc Pro B70 скорость предварительной обработки промпта с контекстом в 8192 токена выросла с 432.80 до 1,292.29 токена в секунду — почти втрое. Ещё одно изменение заменяет одинарную точность на половинную (F16) при хранении промежуточных оценок. Это сокращает время обработки на несколько процентов и снижает расход памяти. На других задачах изменений не было.

Почему это важно

Разработчики смогут быстрее запускать более крупные модели GLM на доступных видеокартах Intel Arc, повышая отзывчивость интерактивных ИИ-приложений.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.