В библиотеке llama.cpp появилась поддержка SYCL, ускоряющая flash attention в GLM‑4.7. На видеокарте Intel Arc Pro B70 скорость предварительной обработки промпта с контекстом в 8192 токена выросла с 432.80 до 1,292.29 токена в секунду — почти втрое. Ещё одно изменение заменяет одинарную точность на половинную (F16) при хранении промежуточных оценок. Это сокращает время обработки на несколько процентов и снижает расход памяти. На других задачах изменений не было.
Почему это важно
Разработчики смогут быстрее запускать более крупные модели GLM на доступных видеокартах Intel Arc, повышая отзывчивость интерактивных ИИ-приложений.