# llama.cpp får flash-attention-kärnor för Metal på macOS

> Den öppna LLM-miljön släppte nya binärfiler med stöd för 128/96 flash-attention för Apple Silicon den 9 okt 2026.

Oossa · 2026-10-09 · https://oossa.com/sv/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

Teamet ggml-org uppdaterade llama.cpp (version b11518) den 9 okt 2026. Uppdateringen lägger till 128-bitars och 96-bitars flash-attention-kärnor för Metal, vilket snabbar upp inferens på Mac-datorer med Apple Silicon. Förkompilerade binärfiler för macOS (arm64), macOS Intel, iOS och flera Linux-konfigurationer finns att ladda ner.

## Fakta

- Version b11518 publicerades fre 09 okt 2026
- Lägger till flash-attention-kärnor för Metal (128/96) för Apple Silicon

## Varför det spelar roll

Användare med Apple Silicon kan köra LLM:er snabbare utan att köpa extra GPU-hårdvara.

## Källor och referenser

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

Senast uppdaterad: 2026-10-09
