Oossa

llama.cpp добавил MTP для GLM5‑Next и ускорил работу

В открытом LLM-раннере появилась поддержка новой MTP-головы GLM5‑Next: задержка при обработке 4 токенов сократилась до 0.33 ms.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Проект llama.cpp выпустил версию b11474 2026‑10‑07. В раннер моделей добавлен граф многотокенного предсказания (MTP) GLM5‑Next под названием NextN. Благодаря этому код пропускает ненужные вычисления, когда не требуется ни одной выходной строки, и задержка при обработке 4 токенов сократилась с 6.9 ms до 0.33 ms. Обновление также исправляет контракты извлечения данных и улучшает обработку частичных откатов рекуррентных состояний.

Почему это важно

Разработчики теперь могут быстрее запускать модели в llama.cpp, особенно при генерации на основе черновиков, использующей многотокенное предсказание.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.