# llama.cpp b11494 otimiza o uso de warps CUDA

> A biblioteca de código aberto llama.cpp passa a usar quatro colunas de estado GDN por warp CUDA, melhorando o desempenho na GPU.

Oossa · 2026-10-08 · https://oossa.com/pt/llama-cpp-release-b11494-adds-cuda-warp-optimizations

A equipe ggml-org lançou a versão b11494 do llama.cpp. A atualização altera o backend CUDA para atribuir quatro colunas de estado GDN a cada warp, em vez de duas. Essa configuração passa a ser o padrão. Estão disponíveis para download binários para macOS (Apple Silicon e Intel), iOS e várias versões do Ubuntu.

## Os fatos

- A versão b11494 foi publicada em 2026-10-08
- O valor padrão de cols_per_warp no CUDA passou a ser 4

## Por que importa

Desenvolvedores que usam llama.cpp em GPUs NVIDIA podem esperar uma inferência mais rápida sem precisar alterar o código.

## Fontes e referências

1. [ggml-org/llama.cpp b11494](https://github.com/ggml-org/llama.cpp/releases/tag/b11494) – llama.cpp, 2026-10-08

Última atualização: 2026-10-08
