L’équipe ggml‑org a publié la version b11489 de llama.cpp. Cette mise à jour accélère la déquantification des poids Q6_K — une étape qui reconvertit les poids compressés d’un modèle en nombres utilisables — et double le facteur de déroulage de boucle, selon les notes de version. Des binaires précompilés sont désormais disponibles pour Apple Silicon, les Mac Intel, iOS et plusieurs configurations Ubuntu, notamment avec Vulkan et CUDA.
Pourquoi c'est important
Une déquantification plus rapide permet aux développeurs d’exécuter des LLM sur le même matériel avec une latence réduite.