Oossa

llama.cpp 업데이트, Intel Arc GPU에서 GLM 프롬프트 처리 속도 향상

새 SYCL 변경 사항으로 Intel Arc Pro B70의 토큰 처리량이 최대 3배 늘고, 플래시 어텐션의 메모리 트래픽은 줄었다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

llama.cpp 라이브러리에 GLM‑4.7 플래시 어텐션을 가속하는 SYCL 지원이 추가됐다. Intel Arc Pro B70 GPU에서 8192토큰 컨텍스트의 프롬프트 프리필 속도는 초당 432.80토큰에서 1,292.29토큰으로 올라 거의 3배 빨라졌다. 또 다른 개선 사항은 중간 점수를 단정밀도 대신 반정밀도(F16)로 저장해 메모리 사용량을 줄이고 처리 시간을 몇 퍼센트 단축한다. 다른 작업의 성능은 그대로였다.

왜 중요한가

개발자는 가격 부담이 적은 Intel Arc GPU에서 더 큰 GLM 모델을 빠르게 실행해 대화형 AI 앱의 응답성을 높일 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.