Die Open-Source-Bibliothek llama.cpp hat einen Vulkan-Fix für MoE-optimierte Matrixmultiplikation erhalten. Die Änderung passt an, wie der Code die Kachelgrößen für die Operation mat_mul_id auswählt, sodass sie der tatsächlichen Zahl aktiver Zeilen pro Experte entsprechen. In einem Test mit einem Modell mit 30 Milliarden Parametern reduzierte der Fix Leerlaufarbeit der GPU, die zuvor 55 % der Laufzeit beansprucht hatte.
Warum es wichtig ist
Weniger GPU-Leerlauf bedeutet schnellere Inferenz bei großen MoE-Modellen auf Vulkan-kompatibler Hardware.