# Atualização do llama.cpp reduz pela metade a memória do indexador

> A versão b11372 altera o indexador do Qwen4exp para usar bem menos RAM, sem perda de velocidade, em execuções com contexto longo.

Oossa · 2026-10-03 · https://oossa.com/pt/llama-cpp-update-cuts-indexer-memory-use-in-half

O projeto ggml‑org/llama.cpp lançou a versão b11372 em 3 de outubro de 2026. A atualização reformula o indexador do Qwen4exp para que cada cabeça calcule sua pontuação separadamente e grave os resultados diretamente. Isso reduz pela metade a memória necessária para os buffers de pontuação do indexador, que eram os maiores consumidores de memória em grafos com contexto longo. A mudança não afeta a velocidade de processamento e também adiciona suporte ao novo indexador lightning nos back-ends CUDA, Metal e Vulkan.

## Os fatos

- A tag de lançamento b11372 foi publicada no sábado, 3 de outubro de 2026
- A memória usada pelas pontuações do indexador foi reduzida em cerca de 50%

## Por que importa

Desenvolvedores que executam modelos de linguagem grandes com contexto longo poderão usar prompts maiores no mesmo hardware.

## Fontes e referências

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

Última atualização: 2026-10-03
