ggml‑org 팀은 2026년 10월 9일 llama.cpp(릴리스 b11518)를 업데이트했습니다. 이번 업데이트에는 Metal용 128비트 및 96비트 플래시 어텐션 커널이 추가돼 Apple Silicon Mac에서 추론 속도가 빨라집니다. macOS(arm64), Intel Mac, iOS 및 여러 Linux 환경에서 사용할 수 있는 사전 빌드 바이너리를 다운로드할 수 있습니다.
왜 중요한가
Apple Silicon 사용자는 GPU 하드웨어를 추가로 구매하지 않고도 LLM을 더 빠르게 실행할 수 있습니다.