Проект ggml‑org/llama.cpp выпустил новую версию 7 октября 2026 года. В ней изменён механизм выбора токенов: при нулевой температуре модель всегда выбирает токен с наибольшей вероятностью. При более высоких значениях температуры и запросах с пользовательским распределением вероятностей сохраняется случайный выбор. Изменение распространяется на запуски на CPU, а также на режимы с грамматикой или бюджетом рассуждений.
Почему это важно
Разработчики могут получать более предсказуемые результаты при детерминированной генерации текста — без дополнительной настройки.