11 октября 2026 года вышла версия библиотеки llama.cpp b11559. В ней улучшена работа OpenCL для более быстрого выделения факторов, а также добавлена поддержка декодирования Gemma‑4 на GPU Qualcomm E4B и E2B. Кроме того, оптимизированы пути декодирования DK64 и DK128 для различных настроек квантования. Соавтором изменений стал Хунцян Ван из Qualcomm.
Почему это важно
Разработчики смогут быстрее запускать модели Gemma‑4 на совместимых GPU Qualcomm, расширяя возможности ИИ на периферийных устройствах.