# llama.cpp, 인텔 Vulkan 빌드에 2개 단위 F32 로드 추가

> 이번 업데이트는 한 번에 float 두 개를 불러와 인텔 GPU의 행렬 곱셈 속도를 높인다.

Oossa · 2026-09-30 · https://oossa.com/ko/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

llama.cpp 프로젝트가 Vulkan 코드에서 32비트 부동소수점(F32)을 불러오는 방식을 바꾸는 패치를 공개했다. 인텔 GPU에서는 float를 하나씩 불러오는 것보다 두 개를 함께 불러오는 편이 빨라, 새 로직은 mul_mat_vec 루틴에서 2개 단위로 정렬된 로드를 사용한다. 누락됐던 정렬 확인도 추가했다. B60 테스트 보드에서 진행한 벤치마크 결과, 특정 행렬 크기에서 최대 1.63 TFLOPS를 기록해 이전 버전보다 눈에 띄게 성능이 향상됐다.

## 팩트

- 패치 공개일: 2026년 9월 30일(b11266)
- 4096×8×14336 행렬에서 최대 1.63 TFLOPS의 속도 향상

## 왜 중요한가

GPU 연산이 빨라지면 인텔 하드웨어에서 llama.cpp를 사용하는 사람들의 LLM 추론 속도도 빨라진다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

최종 업데이트: 2026-09-30
