# llama.cpp b11499 migliora l’operazione roll su CUDA e aggiunge nuovi binari

> La versione b11499 del runtime open source per LLM llama.cpp è uscita l’8 ottobre 2026. Include una correzione CUDA per le operazioni roll su dati non contigui e nuovi binari precompilati per macOS, iOS e Linux.

Oossa · 2026-10-08 · https://oossa.com/it/llama-cpp-v-b11499-adds-cuda-roll-improvement-and-new-binaries

Il team ggml-org ha pubblicato la versione b11499 di llama.cpp l’8 ottobre 2026. L’aggiornamento modifica il backend CUDA, che ora usa stride in byte per l’operazione roll, consentendo alla GPU di gestire correttamente i dati non contigui. La versione include anche nuovi binari per Apple Silicon, Mac con processori Intel, iOS e diverse build di Ubuntu (CPU, Vulkan e CUDA 12). Tutti i file sono disponibili per il download dalla pagina della release su GitHub.

## I fatti

- La versione b11499 è stata pubblicata l’8 ottobre 2026
- Il backend CUDA ora supporta le operazioni roll con stride in byte

## Perché conta

Gli sviluppatori possono eseguire llama.cpp su una gamma più ampia di configurazioni GPU senza errori, ampliando le possibilità di usare LLM in locale su desktop e server.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11499](https://github.com/ggml-org/llama.cpp/releases/tag/b11499) – llama.cpp, 2026-10-08

Ultimo aggiornamento: 2026-10-08
