O projeto ggml‑org/llama.cpp lançou a versão b11372 em 3 de outubro de 2026. A atualização reformula o indexador do Qwen4exp para que cada cabeça calcule sua pontuação separadamente e grave os resultados diretamente. Isso reduz pela metade a memória necessária para os buffers de pontuação do indexador, que eram os maiores consumidores de memória em grafos com contexto longo. A mudança não afeta a velocidade de processamento e também adiciona suporte ao novo indexador lightning nos back-ends CUDA, Metal e Vulkan.
Por que importa
Desenvolvedores que executam modelos de linguagem grandes com contexto longo poderão usar prompts maiores no mesmo hardware.