Il team ggml-org ha pubblicato llama.cpp versione b11510 l’8 ottobre 2026. La nuova versione introduce un kernel PAD iterativo per CUDA, che consente alla libreria di elaborare tensori con oltre 65.000 righe o sezioni. Include anche binari precompilati per Apple Silicon, macOS Intel, iOS e diverse versioni di Ubuntu (CPU, Vulkan e CUDA 12.8). Il codice e le attestazioni sono disponibili tramite la pagina GitHub.
Perché conta
Gli sviluppatori possono ora eseguire modelli linguistici più grandi sulle GPU NVIDIA senza incorrere nel precedente limite di righe.