Oossa

llama.cpp aggiunge kernel flash attention per Metal su macOS

Il runtime LLM open source ha pubblicato il 9 ottobre 2026 nuovi binari con supporto flash attention a 128/96 bit per Apple Silicon.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il team ggml-org ha aggiornato llama.cpp (release b11518) il 9 ottobre 2026. La modifica aggiunge kernel flash attention a 128 e 96 bit per Metal, accelerando l’inferenza sui Mac con Apple Silicon. Sono disponibili per il download binari precompilati per macOS (arm64), macOS Intel, iOS e diverse configurazioni Linux.

Perché conta

Chi usa Apple Silicon può eseguire LLM più velocemente senza acquistare hardware GPU aggiuntivo.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.