Le projet ggml-org/llama.cpp a publié la version b11351 le 2026-10-02. La mise à jour ajoute une méthode alloc_buffer_n à l’interface ggml_backend_buffer_type_i, ainsi qu’une API publique appelée ggml_backend_buft_alloc_buffer_n. L’implémentation par défaut prend désormais en charge la répartition des tampons entre plusieurs appareils et améliore l’allocation des tenseurs. Les types de tampons existants, comme CPU, Metal et OpenVINO, entre autres, reçoivent un pointeur NULL pour cette nouvelle méthode. Des tests ont été ajoutés pour couvrir cette nouvelle fonctionnalité.
Pourquoi c'est important
Les développeurs peuvent désormais gérer la mémoire de manière plus fiable sur différents matériels, ce qui réduit les erreurs d’allocation dans les modèles d’IA.