Das Projekt ggml‑org/llama.cpp hat am 7. Okt. 2026 eine neue Version veröffentlicht. Sie ändert den Sampler: Bei einer Temperatur von null wählt das Modell nun immer das Token mit der höchsten Wahrscheinlichkeit aus (Greedy-Auswahl). Bei höheren Temperaturen und bei benutzerdefinierten Wahrscheinlichkeitsvorgaben bleibt die bisherige Zufallsauswahl bestehen. Die Änderung gilt für CPU-Läufe und für Abläufe mit Grammatikvorgaben oder Reasoning-Budgets.
Warum es wichtig ist
Entwickler erhalten bei Bedarf besser vorhersehbare Ausgaben für die deterministische Textgenerierung – ohne zusätzliche Konfiguration.