# llama.cpp får stöd för MoE-cache på flera GPU:er

> Det öppna biblioteket llama.cpp kan nu köra mixture-of-experts-modeller på flera GPU:er.

Oossa · 2026-10-08 · https://oossa.com/sv/llama-cpp-adds-multi-gpu-moe-cache-support

Teamet ggml-org släppte llama.cpp version b11507 den 8 oktober 2026. Uppdateringen lägger till stöd för en mixture-of-experts-cache (MoE-cache) som kan fördelas över flera GPU:er. Det gör att utvecklare kan köra större MoE-modeller utan att allt behöver rymmas på ett enda kort. Uppdateringen innehåller också nya binärpaket för macOS, iOS och flera Linux-konfigurationer, däribland stöd för CUDA 12.8.

## Fakta

- Version b11507 släpptes 2026-10-08
- Lägger till stöd för MoE-cache på flera GPU:er

## Varför det spelar roll

Utvecklare kan nu köra större och mer avancerade AI-modeller på system med flera GPU:er, vilket utökar möjligheterna med egen hårdvara.

## Källor och referenser

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

Senast uppdaterad: 2026-10-08
