OossaA IA evolui rápido. Nós explicamos de forma simples.

llama.cpp adiciona suporte a produto escalar AVX512-FP16 na b11262

A biblioteca de código aberto llama.cpp agora usa AVX512-FP16 para calcular produtos escalares de meia precisão com acumulação em precisão simples, melhorando o desempenho em CPUs.

NotaOossa1 min de leitura

A equipe ggml-org lançou a versão b11262 do llama.cpp em 29 de setembro de 2026. A atualização adiciona suporte a AVX512-FP16, que calcula produtos escalares em meia precisão (f16), mas acumula os resultados em precisão simples (f32) para maior exatidão. É uma mudança de baixo nível que acelera a inferência em CPUs compatíveis com o conjunto de instruções AVX512-FP16. A versão também inclui novos binários para macOS, iOS e várias distribuições do Linux.

Por que importa

Permite que desenvolvedores executem LLMs mais rapidamente em CPUs modernas sem perder qualidade numérica.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.

Fontes e referências

#FonteVeículoDataPonto principal
1ggml-org/llama.cpp b11262 ↗llama.cpp29 de set. de 2026<details open> ggml : accumulate f16 dot products in f32 on AVX512-FP16 (#29545) Supersedes #29530 Signed-off-by: Adrien Gallouët <angt@hugg

1 fontes

Última atualização: ·Markdown·llms.txt