Oossa

llama.cpp ganha kernels de flash attention para Metal no macOS

O runtime de LLMs de código aberto lançou, em 9 de outubro de 2026, novos binários com suporte a flash attention de 128/96 bits para Apple Silicon.

NotaPor Publicado pelo Oossa: 1 min de leitura

A equipe ggml-org atualizou o llama.cpp (versão b11518) em 9 de outubro de 2026. A atualização adiciona kernels de flash attention de 128 e 96 bits para Metal, acelerando a inferência em Macs com Apple Silicon. Há binários pré-compilados disponíveis para download para macOS (arm64), macOS com processadores Intel, iOS e várias configurações de Linux.

Por que importa

Quem usa Apple Silicon pode executar LLMs mais rapidamente sem comprar hardware adicional de GPU.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.