# llama.cpp ajoute des noyaux Flash Attention Metal sur macOS

> Le moteur de LLM open source publie le 9 octobre 2026 de nouveaux binaires prenant en charge Flash Attention 128/96 sur Apple Silicon.

Oossa · 2026-10-09 · https://oossa.com/fr/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

L’équipe ggml-org a mis à jour llama.cpp (version b11518) le 9 octobre 2026. Cette mise à jour ajoute des noyaux Flash Attention 128 bits et 96 bits pour Metal, afin d’accélérer l’inférence sur les Mac équipés d’Apple Silicon. Des binaires précompilés pour macOS (arm64), les Mac Intel, iOS et plusieurs configurations Linux sont proposés au téléchargement.

## Les faits

- La version b11518 a été publiée le vendredi 9 octobre 2026
- Ajout de noyaux Flash Attention Metal (128/96) pour Apple Silicon

## Pourquoi c'est important

Les utilisateurs d’Apple Silicon peuvent exécuter des LLM plus rapidement sans acheter de matériel GPU supplémentaire.

## Sources et références

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

Dernière mise à jour: 2026-10-09
