A equipe ggml-org atualizou o llama.cpp (versão b11518) em 9 de outubro de 2026. A atualização adiciona kernels de flash attention de 128 e 96 bits para Metal, acelerando a inferência em Macs com Apple Silicon. Há binários pré-compilados disponíveis para download para macOS (arm64), macOS com processadores Intel, iOS e várias configurações de Linux.
Por que importa
Quem usa Apple Silicon pode executar LLMs mais rapidamente sem comprar hardware adicional de GPU.