Het llama.cpp-project bracht op 8 oktober 2026 versie b11509 uit. Deze versie herstelt een fout in de CUDA-controle, waardoor CCCL-versie 4.x ten onrechte als ouder werd aangemerkt. Dat leidde ongemerkt tot lagere prestaties bij de argsort-bewerking. De wijziging vervangt de controle per component door één vergelijking van gepakte gehele getallen, waardoor het snelle pad met strided iterators weer wordt gebruikt. De wijziging is getest op een RTX 4070 met CUDA 13.4 en slaagde voor alle backendtests.
Waarom het ertoe doet
Ontwikkelaars die llama.cpp gebruiken met moderne CUDA-configuraties krijgen sneller sorteerprestaties zonder hun code te hoeven aanpassen.