Het team van ggml-org heeft llama.cpp (release b11518) op 9 okt. 2026 bijgewerkt. De update voegt 128-bit- en 96-bit-flash-attentionkernels voor Metal toe, waarmee inferentie op Macs met Apple Silicon sneller wordt. Er zijn vooraf gebouwde binaries beschikbaar om te downloaden voor macOS (arm64), macOS Intel, iOS en verschillende Linux-configuraties.
Waarom het ertoe doet
Gebruikers van Apple Silicon kunnen LLM's sneller draaien zonder extra GPU-hardware aan te schaffen.