Projektet ggml‑org/llama.cpp släppte en ny version den 7 oktober 2026. Samplern har ändrats så att modellen alltid väljer den token som har högst sannolikhet när temperaturen är noll (girigt urval). Uppdateringen behåller den befintliga slumpmässiga samplingen vid högre temperaturer och vid anpassade sannolikhetsförfrågningar. Ändringen gäller körningar på CPU och även körvägar som använder grammatik eller budgetar för resonemang.
Varför det spelar roll
Utvecklare kan få mer förutsägbara resultat när de behöver deterministisk textgenerering, utan extra konfiguration.