A biblioteca llama.cpp lançou a versão b11559 em 11 de outubro de 2026. Ela traz melhorias no OpenCL para acelerar a alocação de fatores e permite decodificar Gemma‑4 nas GPUs Qualcomm E4B e E2B. A atualização também otimiza os caminhos de decodificação DK64 e DK128 para várias configurações de quantização. As mudanças foram coescritas por Hongqiang Wang, da Qualcomm.
Por que importa
Agora, desenvolvedores podem executar modelos Gemma‑4 com mais rapidez em GPUs Qualcomm compatíveis, ampliando os recursos de IA de borda.