Teamet bakom ggml-org publicerade llama.cpp version b11510 den 8 oktober 2026. Uppdateringen lägger till en loopad PAD-kärna för CUDA, så att biblioteket kan bearbeta tensorer med fler än 65 000 rader eller skivor. Versionen innehåller också färdigbyggda binärfiler för Apple Silicon, Intel-baserade Macar, iOS och flera Ubuntu-varianter (CPU, Vulkan och CUDA 12.8). Kod och intyg finns länkade från GitHub-sidan.
Varför det spelar roll
Utvecklare kan nu köra större språkmodeller på NVIDIA-GPU:er utan att slå i den tidigare begränsningen för antal rader.