L’équipe ggml-org a mis à jour llama.cpp (version b11518) le 9 octobre 2026. Cette mise à jour ajoute des noyaux Flash Attention 128 bits et 96 bits pour Metal, afin d’accélérer l’inférence sur les Mac équipés d’Apple Silicon. Des binaires précompilés pour macOS (arm64), les Mac Intel, iOS et plusieurs configurations Linux sont proposés au téléchargement.
Pourquoi c'est important
Les utilisateurs d’Apple Silicon peuvent exécuter des LLM plus rapidement sans acheter de matériel GPU supplémentaire.