Le projet ggml‑org/llama.cpp a publié une préversion (tag b11272) le 30 septembre 2026. Elle ajoute une optimisation propre à Hexagon pour l’opération de concaténation, courante lors de l’inférence des modèles de langage. Cette modification réduit la surcharge liée aux paquets et utilise une routine de division plus rapide, ce qui accélère la boucle critique qui déplace les données. Cette mise à jour s’inscrit dans une série plus large de builds pour de nombreuses plateformes, notamment les appareils Android équipés de puces Snapdragon et de NPU Hexagon.
Pourquoi c'est important
Elle accélère sensiblement l’exécution des LLM sur les téléphones Snapdragon et réduit la latence des tâches d’IA exécutées sur l’appareil.