Teamet bakom ggml‑org har släppt llama.cpp version b11489. Uppdateringen snabbar upp dekvantiseringen av Q6_K-vikter – ett steg där komprimerade modellvikter omvandlas tillbaka till användbara tal – och fördubblar uppackningsfaktorn, enligt versionsinformationen. Färdigbyggda binärfiler finns nu för Apple Silicon, Intel-macar, iOS och flera Ubuntu-konfigurationer, däribland byggen med Vulkan och CUDA.
Varför det spelar roll
Snabbare dekvantisering gör att utvecklare kan köra stora språkmodeller på samma hårdvara med lägre fördröjning.