30 сентября 2026 года проект llama.cpp выпустил новую версию. В ней появилась поддержка GLM‑5.3‑Flash (также известной как GLM5‑Next) — новой архитектуры языковой модели. Обновление также уменьшает размер буфера вычислений, ускоряет декодирование при работе с длинным контекстом и исправляет несколько ошибок, связанных с обработкой токенов и памятью GPU. Изменения предназначены для разработчиков, которые запускают большие языковые модели локально на CPU или GPU.
Почему это важно
Новые возможности позволяют запускать последние модели GLM быстрее и с меньшим расходом памяти на собственном оборудовании.