# llama.cpp aggiunge kernel flash attention per Metal su macOS

> Il runtime LLM open source ha pubblicato il 9 ottobre 2026 nuovi binari con supporto flash attention a 128/96 bit per Apple Silicon.

Oossa · 2026-10-09 · https://oossa.com/it/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

Il team ggml-org ha aggiornato llama.cpp (release b11518) il 9 ottobre 2026. La modifica aggiunge kernel flash attention a 128 e 96 bit per Metal, accelerando l’inferenza sui Mac con Apple Silicon. Sono disponibili per il download binari precompilati per macOS (arm64), macOS Intel, iOS e diverse configurazioni Linux.

## I fatti

- Il tag della release b11518 è stato pubblicato venerdì 9 ottobre 2026
- Aggiunge kernel flash attention per Metal (128/96) per Apple Silicon

## Perché conta

Chi usa Apple Silicon può eseguire LLM più velocemente senza acquistare hardware GPU aggiuntivo.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

Ultimo aggiornamento: 2026-10-09
