# llama.cpp speichert MoE-Experten jetzt im GPU-Cache

> Die Open-Source-Bibliothek llama.cpp legt Daten von Mixture-of-Experts-Modellen (MoE) nun in einem GPU-Cache im Host-Speicher ab.

Oossa · 2026-10-08 · https://oossa.com/de/llama-cpp-adds-gpu-cache-for-moe-experts

Das Team von ggml-org hat am 2026-10-08 llama.cpp in Version b11480 veröffentlicht. Das Update ergänzt einen GPU-Cache für MoE-Experten, der im Host-Speicher liegt und große Modelle auf GPUs schneller laufen lassen soll. Die Änderung ist als von Claude unterstützt gekennzeichnet und nutzt eine neue API namens llama_moe_cache_ptr. Vorgefertigte Binärdateien für macOS, iOS und mehrere Ubuntu-Konfigurationen stehen zum Download bereit.

## Die Fakten

- Veröffentlichte Version: b11480
- Veröffentlichungsdatum: 2026-10-08

## Warum es wichtig ist

Entwickler können MoE-Modelle jetzt effizienter auf Consumer-GPUs ausführen und so die Hardwarekosten für KI-Projekte senken.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

Zuletzt aktualisiert: 2026-10-08
