Projektet ggml-org/llama.cpp publicerade en förhandsversion (tagg b11272) den 30 september 2026. Den innehåller en Hexagon-specifik optimering för concat-operationen, ett vanligt steg när språkmodeller körs. Ändringen minskar paketoverheaden och använder en snabbare divisionsrutin, vilket snabbar upp den kritiska slinga som flyttar data. Uppdateringen ingår i en större samling versioner för många plattformar, däribland Android-enheter med Snapdragon och Hexagon-NPU:er.
Varför det spelar roll
Den gör det märkbart snabbare att köra LLM:er på Snapdragon-telefoner och minskar fördröjningen vid AI-uppgifter direkt på enheten.