Oossa

llama.cpp voegt GPU-cache toe voor MoE-experts

De opensourcebibliotheek llama.cpp slaat gegevens van mixture-of-experts-modellen (MoE) voortaan op in een GPU-cache in het hostgeheugen.

Kort berichtDoor Gepubliceerd door Oossa: Laatst bijgewerkt: 1 min lezen

Het team van ggml-org bracht op 2026-10-08 versie b11480 van llama.cpp uit. De update voegt een GPU-cache voor MoE-experts toe die in het hostgeheugen wordt bewaard, zodat grote modellen sneller op GPU's kunnen draaien. Bij de wijziging staat vermeld dat Claude heeft geholpen; ook maakt die gebruik van de nieuwe API llama_moe_cache_ptr. Voor macOS, iOS en verschillende Ubuntu-configuraties zijn vooraf gebouwde binaries te downloaden.

Waarom het ertoe doet

Ontwikkelaars kunnen MoE-modellen nu efficiënter draaien op consumentengpu's, waardoor AI-projecten minder krachtige hardware vereisen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.