Il progetto ggml‑org/llama.cpp ha pubblicato una nuova versione il 7 ottobre 2026. La modifica riguarda il sampler: quando la temperatura è zero, il modello sceglie sempre il token con la probabilità più alta (selezione greedy). L’aggiornamento mantiene il campionamento casuale alle temperature più alte e per le richieste con probabilità personalizzate. La modifica si applica alle esecuzioni su CPU e ai percorsi che usano grammatiche o budget di ragionamento.
Perché conta
Gli sviluppatori possono ottenere risultati più prevedibili quando serve generare testo in modo deterministico, senza configurazioni aggiuntive.