Il progetto open source llama.cpp ha pubblicato la versione b11558 l’11 ottobre 2026. L’aggiornamento corregge un bug che faceva superare ai kernel OpenCL i limiti delle immagini dei dispositivi quando si usavano pesi quantizzati Q4_K. Aggiunge inoltre un percorso alternativo per i dispositivi che raggiungono tali limiti e corregge i calcoli di broadcasting e RMS-norm per i kernel Q4_0. Le modifiche sono state realizzate insieme a Hongqiang Wang di Qualcomm.
Perché conta
Gli sviluppatori che usano llama.cpp sulle GPU possono ora eseguire modelli quantizzati Q4_K su più hardware senza arresti anomali.