# llama.cpp lägger till GPU-cache för MoE-experter

> Det öppna biblioteket llama.cpp lagrar nu data för mixture-of-experts-modeller (MoE) i en GPU-cache i värdminnet.

Oossa · 2026-10-08 · https://oossa.com/sv/llama-cpp-adds-gpu-cache-for-moe-experts

Teamet ggml-org släppte llama.cpp version b11480 den 2026-10-08. Uppdateringen lägger till en GPU-cache för MoE-experter i värdminnet, vilket hjälper stora modeller att köras snabbare på GPU:er. Ändringen är markerad som assisterad av Claude och använder det nya API:et llama_moe_cache_ptr. Förkompilerade binärfiler för macOS, iOS och flera Ubuntu-konfigurationer finns att ladda ner.

## Fakta

- Version: b11480
- Utgivningsdatum: 2026-10-08

## Varför det spelar roll

Utvecklare kan nu köra MoE-modeller effektivare på konsument-GPU:er, vilket sänker hårdvarukostnaden för AI-projekt.

## Källor och referenser

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

Senast uppdaterad: 2026-10-08
