O projeto ggml‑org/llama.cpp lançou a versão b11351 em 2026-10-02. A atualização adiciona o método alloc_buffer_n à interface ggml_backend_buffer_type_i, com uma API pública chamada ggml_backend_buft_alloc_buffer_n. A implementação padrão agora permite dividir buffers entre vários dispositivos e aprimora a alocação de tensores. Tipos de buffer existentes, como CPU, Metal, OpenVINO e outros, recebem um marcador NULL para o novo método. Foram adicionados testes para cobrir a nova funcionalidade.
Por que importa
Os desenvolvedores agora podem gerenciar a memória com mais confiabilidade em diferentes tipos de hardware, reduzindo erros de alocação em modelos de IA.