Il progetto llama.cpp ha rilasciato la versione b11490 il 2026‑10‑08. La versione aggiunge il supporto all’API «alloc_buffer_n» di Hexagon, che consente di suddividere i tensori di grandi dimensioni in più buffer. La dimensione predefinita del buffer dinamico passa da 128 MB a 512 MB, per evitare cali di prestazioni con i modelli più grandi. Il nuovo flag «--no-embd-offload» semplifica i comandi per i dispositivi che non possono trasferire gli embedding. Le modifiche sono state cofirmate da Jhen‑Jie Hong.
Perché conta
Gli sviluppatori che usano hardware basato su Hexagon possono eseguire modelli linguistici più grandi in modo più efficiente, senza dover regolare manualmente i buffer.