# llama.cpp krijgt flash-attentionkernels voor Metal op macOS

> De open-source LLM-runtime bracht op 9 okt. 2026 nieuwe binaries uit met ondersteuning voor 128/96 flash-attention op Apple Silicon.

Oossa · 2026-10-09 · https://oossa.com/nl/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

Het team van ggml-org heeft llama.cpp (release b11518) op 9 okt. 2026 bijgewerkt. De update voegt 128-bit- en 96-bit-flash-attentionkernels voor Metal toe, waarmee inferentie op Macs met Apple Silicon sneller wordt. Er zijn vooraf gebouwde binaries beschikbaar om te downloaden voor macOS (arm64), macOS Intel, iOS en verschillende Linux-configuraties.

## De feiten

- Releasetag b11518 gepubliceerd op vrijdag 9 okt. 2026
- Voegt flash-attentionkernels voor Metal (128/96) toe voor Apple Silicon

## Waarom het ertoe doet

Gebruikers van Apple Silicon kunnen LLM's sneller draaien zonder extra GPU-hardware aan te schaffen.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

Laatst bijgewerkt: 2026-10-09
