Проект llama.cpp выпустил версию b11509 8 октября 2026 года. В ней исправлена проверка версии CUDA: она ошибочно считала CCCL версии 4.x более старой, что незаметно снижало производительность операции argsort. Вместо поэлементной проверки теперь используется сравнение одного упакованного целого числа, что возвращает быстрый путь со strided-итератором. Исправление проверили на RTX 4070 с CUDA 13.4; все тесты бэкендов пройдены.
Почему это важно
Разработчики, использующие llama.cpp с современными конфигурациями CUDA, получат более быструю сортировку без изменений в коде.