L’équipe ggml-org a publié la version b11494 de llama.cpp. Cette mise à jour modifie le backend CUDA : chaque warp traite désormais quatre colonnes d’état GDN au lieu de deux. Ce réglage est maintenant activé par défaut. Des binaires pour macOS (Apple Silicon et Intel), iOS et plusieurs versions d’Ubuntu sont disponibles au téléchargement.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp sur des GPU NVIDIA peuvent s’attendre à une inférence plus rapide, sans modifier leur code.