Oossa

llama.cpp dimezza la memoria usata dall’indexer

La versione b11372 modifica l’indexer di Qwen4exp per ridurre drasticamente l’uso di RAM, senza rallentare l’elaborazione dei contesti lunghi.

BreveOossaPubblicato da Oossa: 1 min di lettura

Il progetto ggml‑org/llama.cpp ha rilasciato la versione b11372 il 3 ottobre 2026. L’aggiornamento riscrive l’indexer di Qwen4exp, in modo che ogni head calcoli il proprio punteggio separatamente e scriva i risultati direttamente in memoria. Così si dimezza la memoria necessaria per i buffer dei punteggi dell’indexer, che nei grafi con contesti lunghi erano quelli che ne consumavano di più. La modifica non incide sulla velocità di calcolo e aggiunge anche il supporto al nuovo lightning indexer sui backend CUDA, Metal e Vulkan.

Perché conta

Gli sviluppatori che eseguono modelli linguistici di grandi dimensioni con contesti lunghi potranno gestire prompt più ampi sullo stesso hardware.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.