Il team ggml-org ha pubblicato la versione b11528 di llama.cpp il 2026-10-09. L’aggiornamento consente alla libreria di trattare come nodi normali le viste dei tensor allocati sull’host, eliminando un errore di assert che si verificava con l’opzione –split-mode tensor. Ripristina inoltre il supporto ai tensor SM per l’acceleratore K2 Horizon. La modifica è inclusa nella release ufficiale su GitHub e riguarda tutte le piattaforme elencate, da macOS a Windows e Linux.
Perché conta
Gli sviluppatori possono ora usare llama.cpp con la KV cache suddivisa su più hardware senza incorrere in crash, ampliando le configurazioni disponibili per l’inferenza locale degli LLM.