El proyecto llama.cpp publicó la versión b11509 el 8 de octubre de 2026. Esta corrige una comprobación de CUDA que identificaba erróneamente CCCL 4.x como una versión anterior, lo que provocaba una caída silenciosa del rendimiento de la operación argsort. La corrección sustituye la comprobación componente por componente por una única comparación de enteros empaquetados y restablece la ruta rápida del iterador con pasos. El cambio se probó en una RTX 4070 con CUDA 13.4 y superó todas las pruebas de backend.
Por qué importa
Quienes usan llama.cpp con configuraciones CUDA modernas obtendrán un mayor rendimiento al ordenar, sin tener que cambiar el código.