De llama.cpp-bibliotheek heeft op 3 oktober 2026 een nieuwe versie uitgebracht (b11374). De update brengt de OpenVINO-backend naar versie 2026.4.1, voegt een nieuwe conv-fusion toe, verhelpt fouten met GPU-buffers en corrigeert de asverwerking voor mixture-of-experts-modellen (MoE). De wijzigingen verhogen de snelheid van tokengeneratie bij gefuseerde MoE-modellen en voorkomen crashes op sommige Intel-GPU’s.
Waarom het ertoe doet
Ontwikkelaars die llama.cpp op Intel-GPU’s gebruiken, kunnen OpenVINO nu sneller en met minder crashes inzetten.