L’équipe ggml-org a publié llama.cpp version b11270 le 30 septembre 2026. Cette version modifie une opération GPU utilisée par la plateforme HIP d’AMD, en remplaçant une instruction de soustraction d’octets plus lente par une autre plus rapide. Elle comprend également de nouveaux paquets binaires pour macOS (Apple Silicon et Intel), iOS et plusieurs versions d’Ubuntu, notamment des versions GPU compatibles avec Vulkan.
Pourquoi c'est important
Cette optimisation GPU peut accélérer l’inférence sur le matériel AMD, et les binaires prêts à l’emploi permettent aux développeurs d’essayer plus facilement llama.cpp sur davantage de plateformes.