Le projet llama.cpp a publié une nouvelle préversion, b11517, le 9 octobre 2026. Cette mise à jour ajoute une option CUDA qui permet de transmettre la précision de la source 1 aux fonctions auxiliaires MMQ, une partie bas niveau du code GPU. Le changement, signé par un contributeur de NVIDIA, concerne les versions CUDA 12 et 13 proposées pour Linux et Windows. La version comprend également des cibles de compilation pour de nombreuses autres plateformes, de macOS sur Apple Silicon à Android sur Snapdragon.
La mise à jour est disponible sur la page GitHub du projet et sur le site llama.app.
Pourquoi c'est important
Les développeurs peuvent désormais contrôler la précision GPU dans llama.cpp, ce qui pourrait améliorer les performances ou réduire l’utilisation de la mémoire lors de l’exécution de modèles LLaMA.