# llama.cpp, 다양한 양자화 형식 지원하는 MMA 커널 추가

> Oct 7, 2026 업데이트로 Metal 커널이 BF16, Q 계열 등을 지원한다. Apple M3 Ultra 기기에서 행렬 곱셈 속도도 빨라진다.

Oossa · 2026-10-07 · https://oossa.com/ko/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

llama.cpp 프로젝트가 Oct 7, 2026에 버전 b11476을 공개했다. 이번 버전에는 BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0과 여러 IQ 형식을 지원하는 범용 소수 행 MMA(행렬 곱셈 누산) 커널이 추가됐다. 이 커널은 행 수에 따라 적용되며, Apple M3 Ultra에서 기존 커널보다 빠르게 작동한다. 적용 기준은 TQ2_0이 5행, BF16이 4행, MXFP4·Q2_0·Q2_K·IQ4_NL이 3행, 나머지 형식이 2행이다. 벤치마크에서는 기준 행 수에서 작업 시간이 0.23초에서 0.98초 사이로 단축됐고, 다른 행 수 구간에서도 성능이 개선됐다.

## 팩트

- b11476 버전은 Oct 7, 2026에 공개됐다("Wed Oct 07 2026 16:55:09 GMT+0200").
- 소수 행 MMA 커널이 BF16, Q 계열, MXFP4, IQ 형식 등을 새로 지원하며 M3 Ultra에서 더 빠르게 작동한다.

## 왜 중요한가

M3 Ultra 칩이 탑재된 Mac에서 양자화된 Llama 모델을 더 빠르게 실행할 수 있어 애플리케이션의 추론 시간이 줄어든다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

최종 업데이트: 2026-10-07
