Das Team von ggml-org hat am 2026-10-08 llama.cpp in Version b11498 veröffentlicht. Das Update behebt einen Fehler im CUDA-Kernel, der auftrat, wenn bestimmte Tensor-Dimensionen die Grid-Limits der GPU überschritten. Außerdem enthält es neue vorkompilierte Binärdateien für Apple Silicon, Intel-Macs, iOS und mehrere Ubuntu-Konfigurationen, darunter Builds für CPU, Vulkan und CUDA 12.8.
Warum es wichtig ist
Entwickler können llama.cpp jetzt auf mehr GPU-Konfigurationen ohne Abstürze ausführen und erhalten sofort einsatzbereite Binärdateien für ihre Plattform.