# llama.cpp v0.1.11534 otimiza cópias CUDA

> A biblioteca de inferência LLaMA de código aberto elimina transferências redundantes de memória na GPU, reduzindo a sobrecarga em determinadas cargas de trabalho.

Oossa · 2026-10-09 · https://oossa.com/pt/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

A equipe ggml-org lançou a versão b11534 do llama.cpp em 2026-10-09. A atualização incorpora as cópias de snapshots de estado ao cache recorrente e elimina cópias CUDA extras quando K = 1, um caso de decodificação sem especulação. A mudança se limita ao backend CUDA; as versões para CPU e Vulkan não foram alteradas. Há binários pré-compilados para macOS, iOS e várias versões do Ubuntu disponíveis para download.

Quem usa a versão CUDA deve notar uma pequena redução no tráfego de memória da GPU, o que pode melhorar a velocidade em hardware compatível.

## Os fatos

- A versão b11534 foi lançada em 2026-10-09
- A remoção de cópias CUDA se aplica ao cenário K = 1 (sem decodificação especulativa)

## Por que importa

A inferência pode ficar mais rápida para usuários de CUDA, porque a biblioteca agora transfere menos dados na GPU.

## Fontes e referências

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

Última atualização: 2026-10-09
