# llama.cpp voegt GPU-cache toe voor MoE-experts

> De opensourcebibliotheek llama.cpp slaat gegevens van mixture-of-experts-modellen (MoE) voortaan op in een GPU-cache in het hostgeheugen.

Oossa · 2026-10-08 · https://oossa.com/nl/llama-cpp-adds-gpu-cache-for-moe-experts

Het team van ggml-org bracht op 2026-10-08 versie b11480 van llama.cpp uit. De update voegt een GPU-cache voor MoE-experts toe die in het hostgeheugen wordt bewaard, zodat grote modellen sneller op GPU's kunnen draaien. Bij de wijziging staat vermeld dat Claude heeft geholpen; ook maakt die gebruik van de nieuwe API llama_moe_cache_ptr. Voor macOS, iOS en verschillende Ubuntu-configuraties zijn vooraf gebouwde binaries te downloaden.

## De feiten

- Releaseversie: b11480
- Releasedatum: 2026-10-08

## Waarom het ertoe doet

Ontwikkelaars kunnen MoE-modellen nu efficiënter draaien op consumentengpu's, waardoor AI-projecten minder krachtige hardware vereisen.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

Laatst bijgewerkt: 2026-10-08
