O projeto llama.cpp lançou a versão b11509 em 8 de outubro de 2026. Ela corrige uma verificação do CUDA que identificava incorretamente a versão 4.x do CCCL como mais antiga, causando uma queda silenciosa de desempenho na operação argsort. A correção substitui a checagem componente a componente por uma única comparação de inteiros compactados, restaurando o caminho rápido do iterador com passo. A alteração foi testada em uma RTX 4070 com CUDA 13.4 e passou em todos os testes de backend.
Por que importa
Desenvolvedores que usam llama.cpp em configurações modernas com CUDA terão melhor desempenho de ordenação sem precisar alterar o código.