# llama.cpp ganha opção de mapeamento de memória e reduz cópias de tensores

> O runtime de LLM de código aberto agora permite mapear diretamente os dados do modelo, economizando RAM nas versões para macOS, iOS e Linux.

Oossa · 2026-10-01 · https://oossa.com/pt/llama-cpp-release-adds-memory-map-option-to-cut-tensor-copies

A equipe ggml-org lançou a versão b11324 do llama.cpp. A atualização adiciona um modo de mapeamento de memória que evita criar uma segunda cópia, do mesmo tamanho, de cada tensor ao carregar modelos. A mudança está disponível em novos pacotes binários para macOS (Apple Silicon e Intel), iOS e várias versões do Ubuntu. O lançamento também registra contribuições de Claude e de Pranesh Gonegandla, engenheiro da NVIDIA.

## Os fatos

- Versão b11324 lançada em 2026-10-01
- Adiciona o recurso llama-mmap para reduzir o uso de RAM

## Por que importa

Desenvolvedores podem executar modelos de linguagem maiores no mesmo hardware, o que ajuda entusiastas e equipes pequenas com memória limitada.

## Fontes e referências

1. [ggml-org/llama.cpp b11324](https://github.com/ggml-org/llama.cpp/releases/tag/b11324) – llama.cpp, 2026-10-01

Última atualização: 2026-10-01
