Oossa

llama.cpp ondersteunt MoE-cache op meerdere GPU’s

Met de open-sourcelibrary Llama.cpp kunnen gebruikers nu mixture-of-experts-modellen op meerdere GPU’s draaien.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het team van ggml-org heeft op 8 oktober 2026 versie b11507 van llama.cpp uitgebracht. De update voegt ondersteuning toe voor een mixture-of-experts-cache (MoE) die over meerdere GPU’s kan worden verdeeld. Zo kunnen ontwikkelaars grotere MoE-modellen draaien zonder dat alles op één kaart hoeft te passen. De release bevat ook nieuwe binaire pakketten voor macOS, iOS en verschillende Linux-configuraties, waaronder ondersteuning voor CUDA 12.8.

Waarom het ertoe doet

Ontwikkelaars kunnen nu grotere en krachtigere AI-modellen draaien op systemen met meerdere GPU’s. Dat vergroot de mogelijkheden van hardware voor persoonlijk gebruik.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.