Oossa

llama.cpp unterstützt MoE-Cache auf mehreren GPUs

Mit der Open-Source-Bibliothek Llama.cpp lassen sich Mixture-of-Experts-Modelle jetzt über mehrere GPUs hinweg ausführen.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das ggml-org-Team hat am 8. Oktober 2026 llama.cpp in Version b11507 veröffentlicht. Das Update unterstützt einen Mixture-of-Experts- (MoE-)Cache, der auf mehrere GPUs verteilt werden kann. So können Entwickler größere MoE-Modelle ausführen, ohne alles auf einer einzigen Grafikkarte unterbringen zu müssen. Die Veröffentlichung umfasst außerdem neue Binärpakete für macOS, iOS und verschiedene Linux-Konfigurationen, darunter Unterstützung für CUDA 12.8.

Warum es wichtig ist

Entwickler können damit größere und leistungsfähigere KI-Modelle auf Systemen mit mehreren GPUs ausführen und so mehr mit eigener Hardware umsetzen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.