# llama.cpp v0.2.0: pré-lançamento otimiza CPU Hexagon

> O executor de LLMs de código aberto atualiza o backend Hexagon para acelerar operações de concatenação em chips Snapdragon.

Oossa · 2026-09-30 · https://oossa.com/pt/llama-cpp-v0-2-0-pre-release-adds-hexagon-cpu-optimizations

O projeto ggml-org/llama.cpp publicou uma versão de pré-lançamento (tag b11272) em 30 de setembro de 2026. Ela traz uma otimização específica para o Hexagon na operação de concatenação, uma etapa comum na inferência de modelos de linguagem. A mudança reduz a sobrecarga de pacotes e usa uma rotina de divisão mais rápida, acelerando o ciclo principal que movimenta os dados. A atualização faz parte de um conjunto mais amplo de versões para várias plataformas, incluindo dispositivos Android com Snapdragon e NPUs Hexagon.

## Os fatos

- Tag da versão: b11272 (commit 7fee178), publicada em 30 de setembro de 2026
- A otimização de concatenação para Hexagon reduz o número de pacotes e usa a instrução fast-div

## Por que importa

Ela torna perceptivelmente mais rápida a execução de LLMs em celulares Snapdragon, reduzindo a latência em tarefas de IA realizadas no próprio dispositivo.

## Fontes e referências

1. [ggml-org/llama.cpp b11272](https://github.com/ggml-org/llama.cpp/releases/tag/b11272) – llama.cpp, 2026-09-30

Última atualização: 2026-09-30
