Le projet ggml‑org/llama.cpp a publié une nouvelle version le 7 octobre 2026. Le fonctionnement de l’échantillonneur change : lorsque la température est égale à zéro, le modèle choisit toujours le token le plus probable (sélection gloutonne). La mise à jour conserve l’échantillonnage aléatoire pour les températures plus élevées et les demandes personnalisées de probabilité. Ce changement s’applique aux exécutions sur CPU ainsi qu’aux parcours qui utilisent une grammaire ou des budgets de raisonnement.
Pourquoi c'est important
Les développeurs peuvent obtenir des résultats plus prévisibles lorsqu’ils ont besoin d’une génération de texte déterministe, sans configuration supplémentaire.