Le projet ggml‑org/llama.cpp a publié la version b11530 le 2026‑10‑09. Cette modification maintient le graphe d’échantillonnage du backend statique entre les ubatches : sa structure ne change donc plus pendant les étapes de réservation et de décodage. Elle corrige les plantages qui survenaient lorsque la topologie du graphe changeait après une opération de réservation. Le correctif s’applique à toutes les versions répertoriées — macOS, Linux, Android, Windows et openEuler — ainsi qu’à tous les backends matériels, notamment CUDA, Vulkan et OpenCL.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp rencontreront moins d’erreurs à l’exécution lors de générations à sorties multiples, sur tout processeur ou GPU pris en charge.