3 октября 2026 года вышла новая версия библиотеки llama.cpp (b11374). В ней бэкенд OpenVINO обновлён до версии 2026.4.1, добавлена новая функция conv-fusion, исправлены ошибки с буферами GPU и обработка осей в моделях со смесью экспертов (MoE). Эти изменения ускоряют генерацию токенов в MoE-моделях с fusion и предотвращают сбои на некоторых GPU Intel.
Почему это важно
Разработчики, использующие llama.cpp на GPU Intel, теперь могут работать с OpenVINO быстрее и сталкиваться с меньшим числом сбоев.