# llama.cpp: OpenVINO 2026.4.1 und MoE-Fehlerbehebungen

> Das Update vom 3. Okt. 2026 aktualisiert das OpenVINO-Backend, steigert die Leistung und korrigiert die Verarbeitung von MoE-Modellen in llama.cpp.

Oossa · 2026-10-03 · https://oossa.com/de/llama-cpp-release-adds-openvino-2026-4-1-support-and-moe-fixes

Die llama.cpp-Bibliothek hat am 3. Okt. 2026 eine neue Version (b11374) veröffentlicht. Sie aktualisiert das OpenVINO-Backend auf Version 2026.4.1, ergänzt eine neue Conv-Fusion, behebt Fehler mit GPU-Puffern und korrigiert die Achsenverarbeitung bei Mixture-of-Experts-Modellen (MoE). Die Änderungen beschleunigen die Token-Generierung bei MoE-Modellen mit Fusion und verhindern Abstürze auf einigen Intel-GPUs.

## Die Fakten

- Veröffentlichungsdatum: 3. Okt. 2026 ("Sat Oct 03 2026 13:51:21 GMT+0200")
- OpenVINO wurde auf Version 2026.4.1 aktualisiert; bei gemma-4-26B stieg die Token-Generierungsgeschwindigkeit mit Fusion von 66 t/s auf 1 609 t/s

## Warum es wichtig ist

Entwickler, die llama.cpp auf Intel-GPUs nutzen, können OpenVINO jetzt mit höherer Geschwindigkeit und weniger Abstürzen verwenden.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11374](https://github.com/ggml-org/llama.cpp/releases/tag/b11374) – llama.cpp, 2026-10-03
2. [ggml-org/llama.cpp b11377](https://github.com/ggml-org/llama.cpp/releases/tag/b11377) – llama.cpp, 2026-10-03

Zuletzt aktualisiert: 2026-10-03
