El proyecto ggml‑org/llama.cpp publicó la versión b11351 el 2026-10-02. La actualización añade el método alloc_buffer_n a la interfaz ggml_backend_buffer_type_i, con una API pública llamada ggml_backend_buft_alloc_buffer_n. La implementación predeterminada ahora permite dividir los búferes entre varios dispositivos y mejora la asignación de tensores. Los tipos de búfer existentes, como CPU, Metal y OpenVINO, entre otros, reciben un marcador NULL para el nuevo método. También se añadieron pruebas para cubrir la nueva funcionalidad.
Por qué importa
Los desarrolladores ahora pueden gestionar la memoria de forma más fiable en distintos tipos de hardware, lo que reduce los errores de asignación en modelos de IA.