Das Team von ggml-org hat llama.cpp (Release b11518) am 9. Oktober 2026 aktualisiert. Die Neuerung umfasst Flash-Attention-Kernels für Metal mit 128 Bit und 96 Bit, die die Inferenz auf Macs mit Apple Silicon beschleunigen. Vorgefertigte Binärdateien für macOS (arm64), macOS Intel, iOS und mehrere Linux-Konfigurationen stehen zum Download bereit.
Warum es wichtig ist
Nutzer von Apple-Silicon-Geräten können LLMs schneller ausführen, ohne zusätzliche GPU-Hardware kaufen zu müssen.