OossaL'IA évolue vite. Nous l'expliquons simplement.

llama.cpp b0.1.0 : optimisation GPU et nouveaux binaires

La bibliothèque open source llama.cpp publie la version b11270, qui apporte une optimisation de la soustraction sur GPU et des binaires précompilés pour macOS, iOS et Ubuntu.

BrèveOossa1 min de lecture

L’équipe ggml-org a publié llama.cpp version b11270 le 30 septembre 2026. Cette version modifie une opération GPU utilisée par la plateforme HIP d’AMD, en remplaçant une instruction de soustraction d’octets plus lente par une autre plus rapide. Elle comprend également de nouveaux paquets binaires pour macOS (Apple Silicon et Intel), iOS et plusieurs versions d’Ubuntu, notamment des versions GPU compatibles avec Vulkan.

Pourquoi c'est important

Cette optimisation GPU peut accélérer l’inférence sur le matériel AMD, et les binaires prêts à l’emploi permettent aux développeurs d’essayer plus facilement llama.cpp sur davantage de plateformes.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.

Sources et références

#SourceMédiaDateÀ retenir
1ggml-org/llama.cpp b11270 ↗llama.cpp30 sept. 2026<details open> ggml-cuda: HIP: optimize packed byte subtraction (`__vsubss4` -> `__vsub4`) (#29478) * ggml-cuda: HIP: optimize non-saturatin

1 sources

Dernière mise à jour: ·Markdown·llms.txt