ggml-org hat am 7. Okt. 2026 Version b11466 von llama.cpp veröffentlicht. Das Update behebt die Prüfung von „supports_op“ in flash_attn bei überlappenden Key-Value-Paaren. Außerdem gibt es sofort nutzbare Binärdateien für macOS mit Apple Silicon und Intel-Prozessoren, iOS sowie verschiedene Ubuntu-Versionen (CPU, Vulkan und CUDA 12.8). Die Dateien stehen auf der GitHub-Release-Seite zum Download bereit.
Warum es wichtig ist
Entwickler können die aktuelle llama.cpp-Version auf mehr Plattformen nutzen, ohne den Quellcode selbst kompilieren zu müssen.