Die llama.cpp-Bibliothek hat am 3. Okt. 2026 eine neue Version (b11374) veröffentlicht. Sie aktualisiert das OpenVINO-Backend auf Version 2026.4.1, ergänzt eine neue Conv-Fusion, behebt Fehler mit GPU-Puffern und korrigiert die Achsenverarbeitung bei Mixture-of-Experts-Modellen (MoE). Die Änderungen beschleunigen die Token-Generierung bei MoE-Modellen mit Fusion und verhindern Abstürze auf einigen Intel-GPUs.
Warum es wichtig ist
Entwickler, die llama.cpp auf Intel-GPUs nutzen, können OpenVINO jetzt mit höherer Geschwindigkeit und weniger Abstürzen verwenden.