# llama.cpp добавил MTP для GLM5‑Next и ускорил работу

> В открытом LLM-раннере появилась поддержка новой MTP-головы GLM5‑Next: задержка при обработке 4 токенов сократилась до 0.33 ms.

Oossa · 2026-10-07 · https://oossa.com/ru/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

Проект llama.cpp выпустил версию b11474 2026‑10‑07. В раннер моделей добавлен граф многотокенного предсказания (MTP) GLM5‑Next под названием NextN. Благодаря этому код пропускает ненужные вычисления, когда не требуется ни одной выходной строки, и задержка при обработке 4 токенов сократилась с 6.9 ms до 0.33 ms. Обновление также исправляет контракты извлечения данных и улучшает обработку частичных откатов рекуррентных состояний.

## Факты

- Версия b11474 выпущена 2026‑10‑07 ("Wed Oct 07 2026 15:42:20 GMT+0200")
- Задержка при обработке 4 токенов сократилась с 6.9 ms до 0.33 ms

## Почему это важно

Разработчики теперь могут быстрее запускать модели в llama.cpp, особенно при генерации на основе черновиков, использующей многотокенное предсказание.

## Источники и ссылки

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

Обновлено: 2026-10-07
