# llama.cpp unterstützt MoE-Cache auf mehreren GPUs

> Mit der Open-Source-Bibliothek Llama.cpp lassen sich Mixture-of-Experts-Modelle jetzt über mehrere GPUs hinweg ausführen.

Oossa · 2026-10-08 · https://oossa.com/de/llama-cpp-adds-multi-gpu-moe-cache-support

Das ggml-org-Team hat am 8. Oktober 2026 llama.cpp in Version b11507 veröffentlicht. Das Update unterstützt einen Mixture-of-Experts- (MoE-)Cache, der auf mehrere GPUs verteilt werden kann. So können Entwickler größere MoE-Modelle ausführen, ohne alles auf einer einzigen Grafikkarte unterbringen zu müssen. Die Veröffentlichung umfasst außerdem neue Binärpakete für macOS, iOS und verschiedene Linux-Konfigurationen, darunter Unterstützung für CUDA 12.8.

## Die Fakten

- Version b11507 am 2026-10-08 veröffentlicht
- Fügt MoE-Cache-Unterstützung über mehrere GPUs hinweg hinzu

## Warum es wichtig ist

Entwickler können damit größere und leistungsfähigere KI-Modelle auf Systemen mit mehreren GPUs ausführen und so mehr mit eigener Hardware umsetzen.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

Zuletzt aktualisiert: 2026-10-08
