OossaAI는 빠르게 발전하고 있습니다. 저희가 쉽게 설명해 드립니다.

llama.cpp, 인텔 Vulkan 빌드에 2개 단위 F32 로드 추가

이번 업데이트는 한 번에 float 두 개를 불러와 인텔 GPU의 행렬 곱셈 속도를 높인다.

짧은 소식Oossa1 분 읽기

llama.cpp 프로젝트가 Vulkan 코드에서 32비트 부동소수점(F32)을 불러오는 방식을 바꾸는 패치를 공개했다. 인텔 GPU에서는 float를 하나씩 불러오는 것보다 두 개를 함께 불러오는 편이 빨라, 새 로직은 mul_mat_vec 루틴에서 2개 단위로 정렬된 로드를 사용한다. 누락됐던 정렬 확인도 추가했다. B60 테스트 보드에서 진행한 벤치마크 결과, 특정 행렬 크기에서 최대 1.63 TFLOPS를 기록해 이전 버전보다 눈에 띄게 성능이 향상됐다.

왜 중요한가

GPU 연산이 빨라지면 인텔 하드웨어에서 llama.cpp를 사용하는 사람들의 LLM 추론 속도도 빨라진다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.

출처 및 참고 자료

#출처매체날짜핵심 내용
1ggml-org/llama.cpp b11266 ↗llama.cpp2026. 9. 29.<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp2026. 9. 30.<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 개 출처

최종 업데이트: ·Markdown·llms.txt