A biblioteca llama.cpp lançou uma nova versão (b11374) em 3 de outubro de 2026. Ela atualiza o backend do OpenVINO para a versão 2026.4.1, adiciona uma nova fusão de convoluções, corrige erros de buffer na GPU e o tratamento de eixos em modelos de mistura de especialistas (MoE). As mudanças aumentam a velocidade de geração de tokens em modelos MoE com operações fundidas e evitam falhas em algumas GPUs Intel.
Por que importa
Desenvolvedores que executam o llama.cpp em GPUs Intel agora podem usar o OpenVINO com mais velocidade e menos falhas.