Het project ggml-org/llama.cpp bracht op 2026-10-02 versie b11351 uit. De update voegt de methode alloc_buffer_n toe aan de interface ggml_backend_buffer_type_i, met als publieke API ggml_backend_buft_alloc_buffer_n. De standaardimplementatie ondersteunt nu het verdelen van buffers over meerdere apparaten en een betere toewijzing van tensors. Bestaande buffertypen, zoals CPU, Metal, OpenVINO en andere, krijgen een NULL-placeholder voor de nieuwe methode. Er zijn tests toegevoegd om de nieuwe functionaliteit te controleren.
Waarom het ertoe doet
Ontwikkelaars kunnen geheugen nu betrouwbaarder beheren op uiteenlopende hardware, waardoor allocatiefouten in AI-modellen afnemen.