Het team van ggml-org bracht llama.cpp versie b11510 uit op 8 oktober 2026. De update voegt een PAD-kernel met een lus toe voor CUDA, zodat de bibliotheek tensors met meer dan 65.000 rijen of slices kan verwerken. De release bevat ook vooraf gebouwde binaries voor Apple Silicon, Intel-macs, iOS en verschillende Ubuntu-versies (CPU, Vulkan en CUDA 12.8). De code en attesten zijn gelinkt vanaf de GitHub-pagina.
Waarom het ertoe doet
Ontwikkelaars kunnen nu grotere taalmodellen draaien op NVIDIA-GPU's zonder tegen de eerdere limiet voor het aantal rijen aan te lopen.