Het open-sourceproject llama.cpp heeft op 11 oktober 2026 versie b11558 uitgebracht. De update verhelpt een fout waardoor OpenCL-kernels bij gebruik van Q4_K-gekwantiseerde gewichten de limieten voor apparaat-afbeeldingen konden overschrijden. Ook voegt de update een terugvaloptie toe voor apparaten die tegen die limieten aanlopen en corrigeert die de berekeningen voor broadcasting en RMS-normering in Q4_0-kernels. Aan de wijzigingen werkte ook Hongqiang Wang van Qualcomm mee.
Waarom het ertoe doet
Ontwikkelaars die llama.cpp op GPU's gebruiken, kunnen Q4_K-gekwantiseerde modellen nu op meer hardware draaien zonder crashes.