Il progetto ggml‑org/llama.cpp ha rilasciato la versione b11372 il 3 ottobre 2026. L’aggiornamento riscrive l’indexer di Qwen4exp, in modo che ogni head calcoli il proprio punteggio separatamente e scriva i risultati direttamente in memoria. Così si dimezza la memoria necessaria per i buffer dei punteggi dell’indexer, che nei grafi con contesti lunghi erano quelli che ne consumavano di più. La modifica non incide sulla velocità di calcolo e aggiunge anche il supporto al nuovo lightning indexer sui backend CUDA, Metal e Vulkan.
Perché conta
Gli sviluppatori che eseguono modelli linguistici di grandi dimensioni con contesti lunghi potranno gestire prompt più ampi sullo stesso hardware.