Teamet ggml-org uppdaterade llama.cpp (version b11518) den 9 okt 2026. Uppdateringen lägger till 128-bitars och 96-bitars flash-attention-kärnor för Metal, vilket snabbar upp inferens på Mac-datorer med Apple Silicon. Förkompilerade binärfiler för macOS (arm64), macOS Intel, iOS och flera Linux-konfigurationer finns att ladda ner.
Varför det spelar roll
Användare med Apple Silicon kan köra LLM:er snabbare utan att köpa extra GPU-hårdvara.