# llama.cpp añade kernels de flash attention para Metal en macOS

> El entorno de ejecución de LLM de código abierto publicó el 9 de octubre de 2026 nuevos binarios con compatibilidad con flash attention de 128/96 para Apple Silicon.

Oossa · 2026-10-09 · https://oossa.com/es/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

El equipo de ggml‑org actualizó llama.cpp (versión b11518) el 9 de octubre de 2026. La actualización añade kernels de flash attention de 128 y 96 bits para Metal, que aceleran la inferencia en los Mac con Apple Silicon. Se pueden descargar binarios precompilados para macOS (arm64), macOS Intel, iOS y varias configuraciones de Linux.

## Los hechos

- La versión b11518 se publicó el viernes 9 de octubre de 2026
- Añade kernels de flash attention para Metal (128/96) en Apple Silicon

## Por qué importa

Los usuarios de Apple Silicon pueden ejecutar LLM más rápido sin comprar hardware de GPU adicional.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

Última actualización: 2026-10-09
