OossaKI entwickelt sich schnell. Wir erklären es einfach.

llama.cpp verbessert Matrixmultiplikation für MoE-Modelle

Das Release vom 30. September 2026 passt die Kachelauswahl unter Vulkan an und reduziert unnötige Arbeit bei Mixture-of-Experts-Modellen.

KurzmeldungOossa1 Min. Lesezeit

Die Open-Source-Bibliothek llama.cpp hat einen Vulkan-Fix für MoE-optimierte Matrixmultiplikation erhalten. Die Änderung passt an, wie der Code die Kachelgrößen für die Operation mat_mul_id auswählt, sodass sie der tatsächlichen Zahl aktiver Zeilen pro Experte entsprechen. In einem Test mit einem Modell mit 30 Milliarden Parametern reduzierte der Fix Leerlaufarbeit der GPU, die zuvor 55 % der Laufzeit beansprucht hatte.

Warum es wichtig ist

Weniger GPU-Leerlauf bedeutet schnellere Inferenz bei großen MoE-Modellen auf Vulkan-kompatibler Hardware.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.

Quellen und Referenzen

#QuelleMediumDatumKernaussage
1ggml-org/llama.cpp b11265 ↗llama.cpp29.09.2026<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 Quellen

Zuletzt aktualisiert: ·Markdown·llms.txt