# llama.cpp 업데이트, Intel Arc GPU에서 GLM 프롬프트 처리 속도 향상

> 새 SYCL 변경 사항으로 Intel Arc Pro B70의 토큰 처리량이 최대 3배 늘고, 플래시 어텐션의 메모리 트래픽은 줄었다.

Oossa · 2026-10-07 · https://oossa.com/ko/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

llama.cpp 라이브러리에 GLM‑4.7 플래시 어텐션을 가속하는 SYCL 지원이 추가됐다. Intel Arc Pro B70 GPU에서 8192토큰 컨텍스트의 프롬프트 프리필 속도는 초당 432.80토큰에서 1,292.29토큰으로 올라 거의 3배 빨라졌다. 또 다른 개선 사항은 중간 점수를 단정밀도 대신 반정밀도(F16)로 저장해 메모리 사용량을 줄이고 처리 시간을 몇 퍼센트 단축한다. 다른 작업의 성능은 그대로였다.

## 팩트

- Intel Arc Pro B70에서 pp8192 토큰 처리 속도가 초당 432.80토큰에서 1,292.29토큰으로 향상됐다(2.99배).
- 플래시 어텐션 점수를 F16으로 저장하면 pp8192 처리 속도가 4.6% 향상됐다(초당 1,583.9토큰 → 1,657.1토큰).

## 왜 중요한가

개발자는 가격 부담이 적은 Intel Arc GPU에서 더 큰 GLM 모델을 빠르게 실행해 대화형 AI 앱의 응답성을 높일 수 있다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

최종 업데이트: 2026-10-07
