Oossa

llama.cpp añade kernels de flash attention para Metal en macOS

El entorno de ejecución de LLM de código abierto publicó el 9 de octubre de 2026 nuevos binarios con compatibilidad con flash attention de 128/96 para Apple Silicon.

BrevePor Publicado por Oossa: 1 min de lectura

El equipo de ggml‑org actualizó llama.cpp (versión b11518) el 9 de octubre de 2026. La actualización añade kernels de flash attention de 128 y 96 bits para Metal, que aceleran la inferencia en los Mac con Apple Silicon. Se pueden descargar binarios precompilados para macOS (arm64), macOS Intel, iOS y varias configuraciones de Linux.

Por qué importa

Los usuarios de Apple Silicon pueden ejecutar LLM más rápido sin comprar hardware de GPU adicional.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.