O projeto de código aberto llama.cpp lançou a versão b11558 em 11 de outubro de 2026. A atualização corrige um erro que fazia os kernels OpenCL ultrapassarem os limites de imagem do dispositivo ao usar pesos quantizados Q4_K. Também adiciona uma alternativa para dispositivos que atingem esses limites e corrige os cálculos de broadcasting e RMS-norm nos kernels Q4_0. As mudanças foram coescritas por Hongqiang Wang, da Qualcomm.
Por que importa
Desenvolvedores que usam llama.cpp em GPUs podem executar modelos quantizados Q4_K em mais dispositivos sem falhas.