Oossa

llama.cpp v0.1.11534 ottimizza le copie CUDA

La libreria open source per l’inferenza LLaMA elimina trasferimenti ridondanti di memoria GPU, riducendo il carico in alcuni scenari.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il team ggml-org ha rilasciato llama.cpp versione b11534 il 2026-10-09. L’aggiornamento integra le copie degli snapshot dello stato nella cache ricorrente ed elimina copie CUDA aggiuntive quando K = 1, cioè nei casi di decodifica non speculativa. La modifica riguarda solo il backend CUDA: le versioni per CPU e Vulkan restano invariate. Sono disponibili per il download binari precompilati per macOS, iOS e diverse versioni di Ubuntu.

Chi usa la versione CUDA dovrebbe notare un lieve calo del traffico di memoria GPU, che può migliorare la velocità sui dispositivi supportati.

Perché conta

Gli utenti CUDA potrebbero ottenere inferenze più rapide perché la libreria trasferisce meno dati sulla GPU.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.