Oossa

llama.cpp, 다양한 양자화 형식 지원하는 MMA 커널 추가

Oct 7, 2026 업데이트로 Metal 커널이 BF16, Q 계열 등을 지원한다. Apple M3 Ultra 기기에서 행렬 곱셈 속도도 빨라진다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

llama.cpp 프로젝트가 Oct 7, 2026에 버전 b11476을 공개했다. 이번 버전에는 BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0과 여러 IQ 형식을 지원하는 범용 소수 행 MMA(행렬 곱셈 누산) 커널이 추가됐다. 이 커널은 행 수에 따라 적용되며, Apple M3 Ultra에서 기존 커널보다 빠르게 작동한다. 적용 기준은 TQ2_0이 5행, BF16이 4행, MXFP4·Q2_0·Q2_K·IQ4_NL이 3행, 나머지 형식이 2행이다. 벤치마크에서는 기준 행 수에서 작업 시간이 0.23초에서 0.98초 사이로 단축됐고, 다른 행 수 구간에서도 성능이 개선됐다.

왜 중요한가

M3 Ultra 칩이 탑재된 Mac에서 양자화된 Llama 모델을 더 빠르게 실행할 수 있어 애플리케이션의 추론 시간이 줄어든다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.