Oossa

llama.cpp krijgt flash-attentionkernels voor Metal op macOS

De open-source LLM-runtime bracht op 9 okt. 2026 nieuwe binaries uit met ondersteuning voor 128/96 flash-attention op Apple Silicon.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het team van ggml-org heeft llama.cpp (release b11518) op 9 okt. 2026 bijgewerkt. De update voegt 128-bit- en 96-bit-flash-attentionkernels voor Metal toe, waarmee inferentie op Macs met Apple Silicon sneller wordt. Er zijn vooraf gebouwde binaries beschikbaar om te downloaden voor macOS (arm64), macOS Intel, iOS en verschillende Linux-configuraties.

Waarom het ertoe doet

Gebruikers van Apple Silicon kunnen LLM's sneller draaien zonder extra GPU-hardware aan te schaffen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.