Il progetto ggml-org/llama.cpp ha pubblicato il 30 settembre 2026 una build pre-release (tag b11272). L’aggiornamento introduce un’ottimizzazione specifica per Hexagon dell’operazione di concatenazione, comune nell’inferenza dei modelli linguistici. La modifica riduce l’overhead dei pacchetti e impiega una routine di divisione più veloce, accelerando il ciclo più intensivo che sposta i dati. L’aggiornamento rientra in una serie più ampia di build per numerose piattaforme, compresi i dispositivi Android con Snapdragon e NPU Hexagon.
Perché conta
Consente di eseguire gli LLM sui telefoni Snapdragon in modo sensibilmente più rapido, riducendo la latenza delle attività di IA direttamente sul dispositivo.