llama.cpp 라이브러리에 GLM‑4.7 플래시 어텐션을 가속하는 SYCL 지원이 추가됐다. Intel Arc Pro B70 GPU에서 8192토큰 컨텍스트의 프롬프트 프리필 속도는 초당 432.80토큰에서 1,292.29토큰으로 올라 거의 3배 빨라졌다. 또 다른 개선 사항은 중간 점수를 단정밀도 대신 반정밀도(F16)로 저장해 메모리 사용량을 줄이고 처리 시간을 몇 퍼센트 단축한다. 다른 작업의 성능은 그대로였다.
왜 중요한가
개발자는 가격 부담이 적은 Intel Arc GPU에서 더 큰 GLM 모델을 빠르게 실행해 대화형 AI 앱의 응답성을 높일 수 있다.