Oossa

llama.cpp b11510 amplia il supporto CUDA ai tensori più grandi

La libreria open source per l’inferenza di LLaMA arriva alla versione b11510 con un nuovo kernel CUDA, in grado di gestire oltre 65.535 righe, e binari per macOS, iOS e Linux.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il team ggml-org ha pubblicato llama.cpp versione b11510 l’8 ottobre 2026. La nuova versione introduce un kernel PAD iterativo per CUDA, che consente alla libreria di elaborare tensori con oltre 65.000 righe o sezioni. Include anche binari precompilati per Apple Silicon, macOS Intel, iOS e diverse versioni di Ubuntu (CPU, Vulkan e CUDA 12.8). Il codice e le attestazioni sono disponibili tramite la pagina GitHub.

Perché conta

Gli sviluppatori possono ora eseguire modelli linguistici più grandi sulle GPU NVIDIA senza incorrere nel precedente limite di righe.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.