ggml-org hat llama.cpp Version b11462 am 2026-10-07 veröffentlicht. Das Update bereinigt SYCL-basierte Attention-Puffer, eine Low-Level-Schnittstelle für Grafikberechnungen. Außerdem enthält es vorgefertigte Binärdateien für macOS (Apple Silicon und Intel), iOS und mehrere Ubuntu-Varianten, darunter Versionen für CPU, Vulkan und CUDA 12.8. Die Binärdateien stehen auf der GitHub-Release-Seite zum Download bereit.
Warum es wichtig ist
Entwickler können llama.cpp jetzt auf mehr Plattformen lokal nutzen, ohne den Quellcode selbst kompilieren zu müssen. Das beschleunigt das Experimentieren.