Проект llama.cpp выпустил версию b11474 2026‑10‑07. В раннер моделей добавлен граф многотокенного предсказания (MTP) GLM5‑Next под названием NextN. Благодаря этому код пропускает ненужные вычисления, когда не требуется ни одной выходной строки, и задержка при обработке 4 токенов сократилась с 6.9 ms до 0.33 ms. Обновление также исправляет контракты извлечения данных и улучшает обработку частичных откатов рекуррентных состояний.
Почему это важно
Разработчики теперь могут быстрее запускать модели в llama.cpp, особенно при генерации на основе черновиков, использующей многотокенное предсказание.