L’équipe ggml-org a publié la version b11293 de llama.cpp. Elle ajoute des opérations unaires, GLU, binaires et de mise à l’échelle au format BF16 (un format numérique à demi-précision), compatibles avec les CPU et CUDA. La mise à jour des kernels CUDA corrige également un problème de compilation lié au BF16. La nouvelle version est disponible sur de nombreuses plateformes, notamment macOS, Windows, Linux et Android.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter plus rapidement les modèles llama.cpp sur les matériels compatibles avec le BF16, comme les GPU récents.