Il progetto llama.cpp ha pubblicato la versione b11509 l’8 ottobre 2026. La release corregge un controllo di CUDA che identificava erroneamente CCCL 4.x come una versione precedente, causando un calo silenzioso delle prestazioni dell’operazione argsort. La correzione sostituisce il controllo componente per componente con un unico confronto tra interi compatti, ripristinando il percorso rapido con iteratori a passo. La modifica è stata testata su una RTX 4070 con CUDA 13.4 e ha superato tutti i test dei backend.
Perché conta
Gli sviluppatori che usano llama.cpp con configurazioni CUDA recenti otterranno prestazioni migliori nell’ordinamento senza dover modificare il codice.