# llama.cpp passa a oferecer suporte ao OpenVINO 2026.4.1 e corrige falhas em MoE

> A atualização de 3 de outubro de 2026 atualiza o backend do OpenVINO, melhora o desempenho e corrige o processamento de modelos MoE no llama.cpp.

Oossa · 2026-10-03 · https://oossa.com/pt/llama-cpp-release-adds-openvino-2026-4-1-support-and-moe-fixes

A biblioteca llama.cpp lançou uma nova versão (b11374) em 3 de outubro de 2026. Ela atualiza o backend do OpenVINO para a versão 2026.4.1, adiciona uma nova fusão de convoluções, corrige erros de buffer na GPU e o tratamento de eixos em modelos de mistura de especialistas (MoE). As mudanças aumentam a velocidade de geração de tokens em modelos MoE com operações fundidas e evitam falhas em algumas GPUs Intel.

## Os fatos

- Data de lançamento: 3 de outubro de 2026 ("Sat Oct 03 2026 13:51:21 GMT+0200")
- OpenVINO atualizado para 2026.4.1; a velocidade de geração de tokens do gemma-4-26B passou de 66 t/s para 1 609 t/s com a fusão

## Por que importa

Desenvolvedores que executam o llama.cpp em GPUs Intel agora podem usar o OpenVINO com mais velocidade e menos falhas.

## Fontes e referências

1. [ggml-org/llama.cpp b11374](https://github.com/ggml-org/llama.cpp/releases/tag/b11374) – llama.cpp, 2026-10-03
2. [ggml-org/llama.cpp b11377](https://github.com/ggml-org/llama.cpp/releases/tag/b11377) – llama.cpp, 2026-10-03

Última atualização: 2026-10-03
