O projeto llama.cpp lançou a versão b11490 em 2026‑10‑08. A atualização adiciona suporte à API "alloc_buffer_n" da Hexagon, permitindo dividir tensores grandes em vários buffers. O tamanho padrão do buffer dinâmico aumenta de 128 MB para 512 MB para evitar quedas de desempenho com modelos grandes. Uma nova opção, "--no-embd-offload", simplifica a linha de comando em dispositivos que não conseguem transferir embeddings. As mudanças foram coescritas por Jhen‑Jie Hong.
Por que importa
Desenvolvedores que usam hardware baseado em Hexagon podem executar modelos de linguagem maiores com mais eficiência, sem precisar ajustar os buffers manualmente.