# llama.cpp verbessert Matrixmultiplikation für MoE-Modelle

> Das Release vom 30. September 2026 passt die Kachelauswahl unter Vulkan an und reduziert unnötige Arbeit bei Mixture-of-Experts-Modellen.

Oossa · 2026-09-29 · https://oossa.com/de/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

Die Open-Source-Bibliothek llama.cpp hat einen Vulkan-Fix für MoE-optimierte Matrixmultiplikation erhalten. Die Änderung passt an, wie der Code die Kachelgrößen für die Operation mat_mul_id auswählt, sodass sie der tatsächlichen Zahl aktiver Zeilen pro Experte entsprechen. In einem Test mit einem Modell mit 30 Milliarden Parametern reduzierte der Fix Leerlaufarbeit der GPU, die zuvor 55 % der Laufzeit beansprucht hatte.

## Die Fakten

- Release-Version b11265 wurde am 30. September 2026 veröffentlicht
- Im Test mit Sarvam 30B sank der Anteil verschwendeter Rechenleistung von 55 % auf nahezu null

## Warum es wichtig ist

Weniger GPU-Leerlauf bedeutet schnellere Inferenz bei großen MoE-Modellen auf Vulkan-kompatibler Hardware.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

Zuletzt aktualisiert: 2026-09-29
