Das ggml-org-Team hat am 4. Oktober 2026 llama.cpp in Version b11391 veröffentlicht. Das Update verschiebt eine CUDA-Variable namens blocks_per_col an die Stelle, an der sie verwendet wird. Die Änderung wurde von Adrien Gallouët freigegeben. Außerdem enthält die Veröffentlichung neue vorkompilierte Binärdateien für macOS mit Apple Silicon, macOS mit Intel-Prozessoren, iOS sowie mehrere Ubuntu-Versionen (CPU, Vulkan und CUDA 12). Alle Dateien stehen auf der GitHub-Seite der Veröffentlichung zum Download bereit.
Warum es wichtig ist
Entwickler können llama.cpp jetzt ohne zusätzlichen Aufwand auf mehr Hardware ausführen – besonders, wenn sie CUDA-fähige GPUs verwenden.