Das ggml-org-Team hat am 8. Oktober 2026 llama.cpp in Version b11510 veröffentlicht. Die Version enthält einen CUDA-Kernel mit Schleife für PAD, mit dem die Bibliothek Tensoren mit mehr als 65.000 Zeilen oder Slices verarbeiten kann. Außerdem sind vorgefertigte Binärdateien für Apple Silicon, Intel-Macs, iOS und mehrere Ubuntu-Varianten enthalten (CPU, Vulkan und CUDA 12.8). Der Code und die Attestierungen sind auf der GitHub-Seite verlinkt.
Warum es wichtig ist
Entwickler können nun größere Sprachmodelle auf NVIDIA-GPUs ausführen, ohne an die bisherige Zeilenbegrenzung zu stoßen.