O projeto ggml-org/llama.cpp publicou uma versão de pré-lançamento (tag b11272) em 30 de setembro de 2026. Ela traz uma otimização específica para o Hexagon na operação de concatenação, uma etapa comum na inferência de modelos de linguagem. A mudança reduz a sobrecarga de pacotes e usa uma rotina de divisão mais rápida, acelerando o ciclo principal que movimenta os dados. A atualização faz parte de um conjunto mais amplo de versões para várias plataformas, incluindo dispositivos Android com Snapdragon e NPUs Hexagon.
Por que importa
Ela torna perceptivelmente mais rápida a execução de LLMs em celulares Snapdragon, reduzindo a latência em tarefas de IA realizadas no próprio dispositivo.