L’équipe ggml‑org a publié llama.cpp version b11262 le 29 septembre 2026. Cette mise à jour ajoute la prise en charge d’AVX512‑FP16, qui calcule des produits scalaires en demi-précision (f16), mais les accumule en simple précision (f32) pour une meilleure exactitude. Il s’agit d’une modification de bas niveau qui accélère l’inférence sur les processeurs compatibles avec le jeu d’instructions AVX512‑FP16. La version inclut également de nouveaux binaires pour macOS, iOS et plusieurs distributions Linux.
Pourquoi c'est important
Les développeurs peuvent ainsi exécuter des LLM plus rapidement sur les processeurs récents sans perte de qualité numérique.