OossaA IA evolui rápido. Nós explicamos de forma simples.

llama.cpp acelera cargas F32 em builds Vulkan para Intel

A atualização aumenta a velocidade da multiplicação de matrizes em GPUs Intel ao carregar dois valores float de cada vez.

NotaOossa1 min de leitura

O projeto llama.cpp lançou um patch que altera a forma como o código Vulkan carrega valores de ponto flutuante de 32 bits (F32). Em GPUs Intel, carregar dois valores de uma vez é mais rápido do que carregá-los individualmente. Por isso, a nova lógica usa uma carga alinhada a 2 na rotina mul_mat_vec. A alteração também acrescenta uma verificação de alinhamento que estava faltando. Em testes numa placa B60, o desempenho chegou a 1,63 TFLOPS para determinados tamanhos de matriz, um ganho expressivo em relação à versão anterior.

Por que importa

Cálculos mais rápidos na GPU aceleram a inferência de LLMs para quem usa o llama.cpp em hardware Intel.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.

Fontes e referências

#FonteVeículoDataPonto principal
1ggml-org/llama.cpp b11266 ↗llama.cpp29 de set. de 2026<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30 de set. de 2026<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 fontes

Última atualização: ·Markdown·llms.txt