# llama.cpp ondersteunt MoE-cache op meerdere GPU’s

> Met de open-sourcelibrary Llama.cpp kunnen gebruikers nu mixture-of-experts-modellen op meerdere GPU’s draaien.

Oossa · 2026-10-08 · https://oossa.com/nl/llama-cpp-adds-multi-gpu-moe-cache-support

Het team van ggml-org heeft op 8 oktober 2026 versie b11507 van llama.cpp uitgebracht. De update voegt ondersteuning toe voor een mixture-of-experts-cache (MoE) die over meerdere GPU’s kan worden verdeeld. Zo kunnen ontwikkelaars grotere MoE-modellen draaien zonder dat alles op één kaart hoeft te passen. De release bevat ook nieuwe binaire pakketten voor macOS, iOS en verschillende Linux-configuraties, waaronder ondersteuning voor CUDA 12.8.

## De feiten

- Versie b11507 uitgebracht op 2026-10-08
- Voegt ondersteuning toe voor een MoE-cache op meerdere GPU’s

## Waarom het ertoe doet

Ontwikkelaars kunnen nu grotere en krachtigere AI-modellen draaien op systemen met meerdere GPU’s. Dat vergroot de mogelijkheden van hardware voor persoonlijk gebruik.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

Laatst bijgewerkt: 2026-10-08
