# llama.cpp v0.1.11534 ottimizza le copie CUDA

> La libreria open source per l’inferenza LLaMA elimina trasferimenti ridondanti di memoria GPU, riducendo il carico in alcuni scenari.

Oossa · 2026-10-09 · https://oossa.com/it/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

Il team ggml-org ha rilasciato llama.cpp versione b11534 il 2026-10-09. L’aggiornamento integra le copie degli snapshot dello stato nella cache ricorrente ed elimina copie CUDA aggiuntive quando K = 1, cioè nei casi di decodifica non speculativa. La modifica riguarda solo il backend CUDA: le versioni per CPU e Vulkan restano invariate. Sono disponibili per il download binari precompilati per macOS, iOS e diverse versioni di Ubuntu.

Chi usa la versione CUDA dovrebbe notare un lieve calo del traffico di memoria GPU, che può migliorare la velocità sui dispositivi supportati.

## I fatti

- La versione b11534 è stata pubblicata il 2026-10-09
- La rimozione delle copie CUDA si applica quando K = 1 (scenario di decodifica non speculativa)

## Perché conta

Gli utenti CUDA potrebbero ottenere inferenze più rapide perché la libreria trasferisce meno dati sulla GPU.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

Ultimo aggiornamento: 2026-10-09
