El equipo de ggml‑org actualizó llama.cpp (versión b11518) el 9 de octubre de 2026. La actualización añade kernels de flash attention de 128 y 96 bits para Metal, que aceleran la inferencia en los Mac con Apple Silicon. Se pueden descargar binarios precompilados para macOS (arm64), macOS Intel, iOS y varias configuraciones de Linux.
Por qué importa
Los usuarios de Apple Silicon pueden ejecutar LLM más rápido sin comprar hardware de GPU adicional.