De llama.cpp-bibliotheek bracht op 11 oktober 2026 versie b11559 uit. Die bevat OpenCL-verbeteringen voor snellere toewijzing van factoren en ondersteunt Gemma‑4-decodering op Qualcomm E4B- en E2B-gpu’s. Ook zijn de decodeerpaden voor DK64 en DK128 geoptimaliseerd voor verschillende kwantiseringsinstellingen. Hongqiang Wang van Qualcomm werkte mee aan de wijzigingen.
Waarom het ertoe doet
Ontwikkelaars kunnen Gemma‑4-modellen nu sneller draaien op compatibele Qualcomm-gpu’s, wat de mogelijkheden voor edge-AI vergroot.