Oossa

llama.cpp: supporto ai buffer Hexagon e allocazione predefinita più ampia

La libreria open source llama.cpp consente ora ai dispositivi Hexagon di suddividere i tensori di grandi dimensioni e porta a 512 MB la dimensione predefinita del buffer dinamico.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il progetto llama.cpp ha rilasciato la versione b11490 il 2026‑10‑08. La versione aggiunge il supporto all’API «alloc_buffer_n» di Hexagon, che consente di suddividere i tensori di grandi dimensioni in più buffer. La dimensione predefinita del buffer dinamico passa da 128 MB a 512 MB, per evitare cali di prestazioni con i modelli più grandi. Il nuovo flag «--no-embd-offload» semplifica i comandi per i dispositivi che non possono trasferire gli embedding. Le modifiche sono state cofirmate da Jhen‑Jie Hong.

Perché conta

Gli sviluppatori che usano hardware basato su Hexagon possono eseguire modelli linguistici più grandi in modo più efficiente, senza dover regolare manualmente i buffer.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.