Oossa

llama.cpp accélère la déquantification des poids Q6_K

La version b11489 accélère la déquantification des poids Q6_K et ajoute du déroulage de boucle, avec de nouveaux binaires pour macOS, iOS et Linux.

BrèvePar Publié par Oossa: 1 min de lecture

L’équipe ggml‑org a publié la version b11489 de llama.cpp. Cette mise à jour accélère la déquantification des poids Q6_K — une étape qui reconvertit les poids compressés d’un modèle en nombres utilisables — et double le facteur de déroulage de boucle, selon les notes de version. Des binaires précompilés sont désormais disponibles pour Apple Silicon, les Mac Intel, iOS et plusieurs configurations Ubuntu, notamment avec Vulkan et CUDA.

Pourquoi c'est important

Une déquantification plus rapide permet aux développeurs d’exécuter des LLM sur le même matériel avec une latence réduite.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.