Oossa

llama.cpp versnelt het uitpakken van Q6_K-gewichten

Versie b11489 versnelt de dequantisatie van Q6_K-gewichten en verdubbelt de unrollingfactor. Er zijn nieuwe binaries voor macOS, iOS en Linux.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het team van ggml-org heeft llama.cpp versie b11489 uitgebracht. De update versnelt de dequantisatie van Q6_K-gewichten — een stap waarbij gecomprimeerde modelgewichten worden omgezet in bruikbare getallen — en verdubbelt de unrollingfactor, aldus de release notes. Er zijn nu vooraf gebouwde binaries beschikbaar voor Apple Silicon, Intel-macs, iOS en verschillende Ubuntu-configuraties, waaronder builds met Vulkan en CUDA.

Waarom het ertoe doet

Dankzij de snellere dequantisatie kunnen ontwikkelaars LLM’s met minder vertraging op dezelfde hardware draaien.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.