# llama.cpp, macOS Metal용 플래시 어텐션 커널 추가

> 오픈소스 LLM 런타임 llama.cpp가 2026년 10월 9일 Apple Silicon용 128비트·96비트 플래시 어텐션을 지원하는 새 바이너리를 공개했습니다.

Oossa · 2026-10-09 · https://oossa.com/ko/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

ggml‑org 팀은 2026년 10월 9일 llama.cpp(릴리스 b11518)를 업데이트했습니다. 이번 업데이트에는 Metal용 128비트 및 96비트 플래시 어텐션 커널이 추가돼 Apple Silicon Mac에서 추론 속도가 빨라집니다. macOS(arm64), Intel Mac, iOS 및 여러 Linux 환경에서 사용할 수 있는 사전 빌드 바이너리를 다운로드할 수 있습니다.

## 팩트

- 릴리스 태그 b11518이 2026년 10월 9일 금요일에 공개됨
- Apple Silicon용 Metal 플래시 어텐션 커널(128/96비트) 추가

## 왜 중요한가

Apple Silicon 사용자는 GPU 하드웨어를 추가로 구매하지 않고도 LLM을 더 빠르게 실행할 수 있습니다.

## 출처 및 참고 자료

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

최종 업데이트: 2026-10-09
