Il progetto llama.cpp ha pubblicato una nuova versione preliminare, b11517, il 9 ottobre 2026. L’aggiornamento aggiunge un’opzione CUDA che consente di passare la precisione di source-1 agli helper MMQ, un componente di basso livello del codice per GPU. La modifica è firmata da un collaboratore di NVIDIA e riguarda le build CUDA 12 e 13 indicate per Linux e Windows. La versione include anche target di compilazione per molte altre piattaforme, da macOS con Apple Silicon ad Android con Snapdragon.
L’aggiornamento è disponibile sulla pagina GitHub del progetto e sul sito llama.app.
Perché conta
Gli sviluppatori possono ora controllare la precisione della GPU in llama.cpp, con possibili miglioramenti delle prestazioni o dell’uso della memoria durante l’esecuzione di modelli LLaMA.