Oossa

llama.cpp speichert MoE-Experten jetzt im GPU-Cache

Die Open-Source-Bibliothek llama.cpp legt Daten von Mixture-of-Experts-Modellen (MoE) nun in einem GPU-Cache im Host-Speicher ab.

KurzmeldungVon Von Oossa veröffentlicht: Zuletzt aktualisiert: 1 Min. Lesezeit

Das Team von ggml-org hat am 2026-10-08 llama.cpp in Version b11480 veröffentlicht. Das Update ergänzt einen GPU-Cache für MoE-Experten, der im Host-Speicher liegt und große Modelle auf GPUs schneller laufen lassen soll. Die Änderung ist als von Claude unterstützt gekennzeichnet und nutzt eine neue API namens llama_moe_cache_ptr. Vorgefertigte Binärdateien für macOS, iOS und mehrere Ubuntu-Konfigurationen stehen zum Download bereit.

Warum es wichtig ist

Entwickler können MoE-Modelle jetzt effizienter auf Consumer-GPUs ausführen und so die Hardwarekosten für KI-Projekte senken.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.