# llama.cpp ganha kernels de flash attention para Metal no macOS

> O runtime de LLMs de código aberto lançou, em 9 de outubro de 2026, novos binários com suporte a flash attention de 128/96 bits para Apple Silicon.

Oossa · 2026-10-09 · https://oossa.com/pt/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

A equipe ggml-org atualizou o llama.cpp (versão b11518) em 9 de outubro de 2026. A atualização adiciona kernels de flash attention de 128 e 96 bits para Metal, acelerando a inferência em Macs com Apple Silicon. Há binários pré-compilados disponíveis para download para macOS (arm64), macOS com processadores Intel, iOS e várias configurações de Linux.

## Os fatos

- A versão b11518 foi publicada na sexta-feira, 9 de outubro de 2026
- Adiciona kernels de flash attention para Metal (128/96) em Apple Silicon

## Por que importa

Quem usa Apple Silicon pode executar LLMs mais rapidamente sem comprar hardware adicional de GPU.

## Fontes e referências

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

Última atualização: 2026-10-09
