# llama.cpp b11494 ottimizza i warp CUDA

> La libreria open source Llama.cpp assegna ora quattro colonne di stato GDN a ogni warp CUDA, migliorando le prestazioni della GPU.

Oossa · 2026-10-08 · https://oossa.com/it/llama-cpp-release-b11494-adds-cuda-warp-optimizations

Il team ggml-org ha rilasciato la versione b11494 di llama.cpp. L’aggiornamento modifica il backend CUDA, assegnando a ogni warp quattro colonne di stato GDN anziché due. Questa impostazione è ora predefinita. Sono disponibili per il download i binari per macOS (Apple Silicon e Intel), iOS e diverse versioni di Ubuntu.

## I fatti

- Il tag di rilascio b11494 è stato pubblicato il 2026-10-08
- Il valore predefinito di cols_per_warp per CUDA è stato impostato a 4

## Perché conta

Chi usa llama.cpp con GPU NVIDIA può aspettarsi un’inferenza più veloce senza dover modificare il proprio codice.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11494](https://github.com/ggml-org/llama.cpp/releases/tag/b11494) – llama.cpp, 2026-10-08

Ultimo aggiornamento: 2026-10-08
