Oossa

llama.cpp ajoute des noyaux Flash Attention Metal sur macOS

Le moteur de LLM open source publie le 9 octobre 2026 de nouveaux binaires prenant en charge Flash Attention 128/96 sur Apple Silicon.

BrèvePar Publié par Oossa: 1 min de lecture

L’équipe ggml-org a mis à jour llama.cpp (version b11518) le 9 octobre 2026. Cette mise à jour ajoute des noyaux Flash Attention 128 bits et 96 bits pour Metal, afin d’accélérer l’inférence sur les Mac équipés d’Apple Silicon. Des binaires précompilés pour macOS (arm64), les Mac Intel, iOS et plusieurs configurations Linux sont proposés au téléchargement.

Pourquoi c'est important

Les utilisateurs d’Apple Silicon peuvent exécuter des LLM plus rapidement sans acheter de matériel GPU supplémentaire.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.