Il team ggml-org ha aggiornato llama.cpp (release b11518) il 9 ottobre 2026. La modifica aggiunge kernel flash attention a 128 e 96 bit per Metal, accelerando l’inferenza sui Mac con Apple Silicon. Sono disponibili per il download binari precompilati per macOS (arm64), macOS Intel, iOS e diverse configurazioni Linux.
Perché conta
Chi usa Apple Silicon può eseguire LLM più velocemente senza acquistare hardware GPU aggiuntivo.