# llama.cpp acelera cargas F32 em builds Vulkan para Intel

> A atualização aumenta a velocidade da multiplicação de matrizes em GPUs Intel ao carregar dois valores float de cada vez.

Oossa · 2026-09-30 · https://oossa.com/pt/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

O projeto llama.cpp lançou um patch que altera a forma como o código Vulkan carrega valores de ponto flutuante de 32 bits (F32). Em GPUs Intel, carregar dois valores de uma vez é mais rápido do que carregá-los individualmente. Por isso, a nova lógica usa uma carga alinhada a 2 na rotina mul_mat_vec. A alteração também acrescenta uma verificação de alinhamento que estava faltando. Em testes numa placa B60, o desempenho chegou a 1,63 TFLOPS para determinados tamanhos de matriz, um ganho expressivo em relação à versão anterior.

## Os fatos

- Patch lançado em 30 de setembro de 2026 (b11266)
- Aumento de desempenho para até 1,63 TFLOPS numa matriz 4096×8×14336

## Por que importa

Cálculos mais rápidos na GPU aceleram a inferência de LLMs para quem usa o llama.cpp em hardware Intel.

## Fontes e referências

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

Última atualização: 2026-09-30
