O projeto ggml‑org/llama.cpp lançou uma nova versão em 7 de outubro de 2026. A alteração no amostrador faz com que, quando a temperatura é zero, o modelo sempre escolha o token de maior probabilidade (seleção gulosa). A atualização mantém a amostragem aleatória para temperaturas mais altas e para solicitações de probabilidades personalizadas. A mudança se aplica à execução na CPU e aos fluxos que usam gramáticas ou limites de raciocínio.
Por que importa
Desenvolvedores podem obter resultados mais previsíveis quando precisam gerar texto de forma determinística, sem configurações adicionais.