A equipe ggml-org lançou a versão b11262 do llama.cpp em 29 de setembro de 2026. A atualização adiciona suporte a AVX512-FP16, que calcula produtos escalares em meia precisão (f16), mas acumula os resultados em precisão simples (f32) para maior exatidão. É uma mudança de baixo nível que acelera a inferência em CPUs compatíveis com o conjunto de instruções AVX512-FP16. A versão também inclui novos binários para macOS, iOS e várias distribuições do Linux.
Por que importa
Permite que desenvolvedores executem LLMs mais rapidamente em CPUs modernas sem perder qualidade numérica.