Projektet llama.cpp släppte version b11509 den 8 oktober 2026. Uppdateringen rättar en CUDA-kontroll som felaktigt identifierade CCCL version 4.x som äldre, vilket ledde till att argsort-operationen i tysthet blev långsammare. Den nya kontrollen ersätter jämförelser av enskilda komponenter med en enda jämförelse av ett packat heltal och återställer därmed den snabba sökvägen med strided iterator. Ändringen testades på ett RTX 4070 med CUDA 13.4 och klarade alla backend-tester.
Varför det spelar roll
Utvecklare som använder llama.cpp med moderna CUDA-konfigurationer får snabbare sortering utan att behöva ändra sin kod.