Het team van ggml-org heeft llama.cpp versie b11489 uitgebracht. De update versnelt de dequantisatie van Q6_K-gewichten — een stap waarbij gecomprimeerde modelgewichten worden omgezet in bruikbare getallen — en verdubbelt de unrollingfactor, aldus de release notes. Er zijn nu vooraf gebouwde binaries beschikbaar voor Apple Silicon, Intel-macs, iOS en verschillende Ubuntu-configuraties, waaronder builds met Vulkan en CUDA.
Waarom het ertoe doet
Dankzij de snellere dequantisatie kunnen ontwikkelaars LLM’s met minder vertraging op dezelfde hardware draaien.