Biblioteket llama.cpp släppte version b11559 den 11 okt. 2026. Den innehåller OpenCL-förbättringar som snabbar upp faktorallokeringen och stöd för avkodning av Gemma‑4 på Qualcomm E4B- och E2B-GPU:er. Uppdateringen optimerar också avkodningsvägarna för DK64 och DK128 med olika kvantiseringsinställningar. Ändringarna skrevs tillsammans med Hongqiang Wang från Qualcomm.
Varför det spelar roll
Utvecklare kan nu köra Gemma‑4-modeller snabbare på kompatibla Qualcomm-GPU:er, vilket utökar möjligheterna för edge-AI.