La libreria llama.cpp ha pubblicato una nuova versione (b11374) il 3 ottobre 2026. L’aggiornamento porta il backend OpenVINO alla versione 2026.4.1, aggiunge una nuova fusione delle convoluzioni, corregge gli errori dei buffer GPU e sistema la gestione degli assi nei modelli mixture-of-experts (MoE). Le modifiche aumentano la velocità di generazione dei token nei modelli MoE con operatori fusi e prevengono gli arresti anomali su alcune GPU Intel.
Perché conta
Gli sviluppatori che usano llama.cpp su GPU Intel possono ora sfruttare OpenVINO con prestazioni migliori e meno arresti anomali.