Das Team von ggml-org hat llama.cpp b11499 am 8. Okt. 2026 veröffentlicht. Das Update ändert das CUDA-Backend so, dass die Roll-Operation Byte-Stride-Werte verwendet. Dadurch kann die GPU nicht zusammenhängende Daten korrekt verarbeiten. Außerdem enthält die Veröffentlichung neue Binärdateien für Apple Silicon, Intel-Macs, iOS und verschiedene Ubuntu-Versionen (CPU, Vulkan und CUDA 12). Alle Dateien stehen auf der GitHub-Release-Seite zum Download bereit.
Warum es wichtig ist
Entwickler können llama.cpp auf mehr GPU-Konfigurationen fehlerfrei ausführen und so lokale LLMs auf Desktop-Rechnern und Servern nutzen.