Biblioteket llama.cpp släpptes i en ny version (b11374) den 3 oktober 2026. OpenVINO-bakänden uppdateras till version 2026.4.1, stöd för ny konvolutionsfusion läggs till, fel med GPU-buffertar åtgärdas och axelhanteringen för mixture-of-experts-modeller (MoE) rättas till. Ändringarna ökar hastigheten på token-genereringen för MoE-modeller med fusion och förhindrar krascher på vissa Intel-GPU:er.
Varför det spelar roll
Utvecklare som kör llama.cpp på Intel-GPU:er kan nu använda OpenVINO med högre hastighet och färre krascher.