Oossa

llama.cpp bringt Flash-Attention-Kernels für Metal auf den Mac

Die Open-Source-LLM-Laufzeitumgebung hat am 9. Oktober 2026 neue Binärdateien mit Flash-Attention-Unterstützung für 128/96 für Apple Silicon veröffentlicht.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das Team von ggml-org hat llama.cpp (Release b11518) am 9. Oktober 2026 aktualisiert. Die Neuerung umfasst Flash-Attention-Kernels für Metal mit 128 Bit und 96 Bit, die die Inferenz auf Macs mit Apple Silicon beschleunigen. Vorgefertigte Binärdateien für macOS (arm64), macOS Intel, iOS und mehrere Linux-Konfigurationen stehen zum Download bereit.

Warum es wichtig ist

Nutzer von Apple-Silicon-Geräten können LLMs schneller ausführen, ohne zusätzliche GPU-Hardware kaufen zu müssen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.