Il progetto ggml-org/llama.cpp ha rilasciato la versione b11351 il 2026-10-02. L’aggiornamento aggiunge il metodo alloc_buffer_n all’interfaccia ggml_backend_buffer_type_i e introduce l’API pubblica ggml_backend_buft_alloc_buffer_n. L’implementazione predefinita ora supporta la suddivisione dei buffer tra più dispositivi e migliora l’allocazione dei tensori. Per i tipi di buffer esistenti, come CPU, Metal, OpenVINO e altri, il nuovo metodo viene impostato su NULL. Sono stati aggiunti test per verificare la nuova funzionalità.
Perché conta
Gli sviluppatori possono gestire la memoria in modo più affidabile su hardware diversi, riducendo gli errori di allocazione nei modelli di IA.