11 октября 2026 года проект с открытым исходным кодом llama.cpp выпустил версию b11558. В обновлении исправлена ошибка, из-за которой ядра OpenCL превышали ограничения устройств на размер изображений при использовании квантованных весов Q4_K. Также добавлен запасной путь для устройств, достигающих этих ограничений, и исправлены расчёты широковещательной передачи и RMS-нормализации в ядрах Q4_0. Изменения были подготовлены в соавторстве с Хунцян Ваном из Qualcomm.
Почему это важно
Разработчики, использующие llama.cpp на графических процессорах, теперь смогут запускать квантованные модели Q4_K на большем числе устройств без сбоев.