# llama.cpp voegt OpenVINO 2026.4.1-ondersteuning en MoE-fixes toe

> De update van 3 oktober 2026 vernieuwt de OpenVINO-backend, verbetert de prestaties en corrigeert de verwerking van MoE-modellen in llama.cpp.

Oossa · 2026-10-03 · https://oossa.com/nl/llama-cpp-release-adds-openvino-2026-4-1-support-and-moe-fixes

De llama.cpp-bibliotheek heeft op 3 oktober 2026 een nieuwe versie uitgebracht (b11374). De update brengt de OpenVINO-backend naar versie 2026.4.1, voegt een nieuwe conv-fusion toe, verhelpt fouten met GPU-buffers en corrigeert de asverwerking voor mixture-of-experts-modellen (MoE). De wijzigingen verhogen de snelheid van tokengeneratie bij gefuseerde MoE-modellen en voorkomen crashes op sommige Intel-GPU’s.

## De feiten

- Releasedatum: 3 oktober 2026 ("Sat Oct 03 2026 13:51:21 GMT+0200")
- OpenVINO bijgewerkt naar 2026.4.1; de tokengeneratiesnelheid voor gemma-4-26B steeg bij gebruik van fusion van 66 t/s naar 1 609 t/s

## Waarom het ertoe doet

Ontwikkelaars die llama.cpp op Intel-GPU’s gebruiken, kunnen OpenVINO nu sneller en met minder crashes inzetten.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11374](https://github.com/ggml-org/llama.cpp/releases/tag/b11374) – llama.cpp, 2026-10-03
2. [ggml-org/llama.cpp b11377](https://github.com/ggml-org/llama.cpp/releases/tag/b11377) – llama.cpp, 2026-10-03

Laatst bijgewerkt: 2026-10-03
