La bibliothèque ggml‑org/llama.cpp a publié la version b11475 le 7 octobre 2026. Celle-ci corrige un bug du backend Metal (GPU Apple) : lors d’une opération fusionnée MUL_MAT+ADD, celui-ci sélectionnait la mauvaise matrice résiduelle, ce qui produisait des résultats erronés pour les modèles effectuant plusieurs multiplications matricielles en une étape. Le correctif permet à l’encodeur de choisir le bon opérande et rétablit la précision des résultats sur les GPU Metal.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp sur des GPU Apple obtiendront désormais des résultats fiables, au lieu des probabilités uniformes produites auparavant.