# llama.cpp b11499 corrige operação CUDA e traz novos binários

> O runtime de LLM de código aberto llama.cpp lançou a versão b11499 em 8 de outubro de 2026, com uma correção de CUDA para operações roll em dados não contíguos e novos binários pré-compilados para macOS, iOS e Linux.

Oossa · 2026-10-08 · https://oossa.com/pt/llama-cpp-v-b11499-adds-cuda-roll-improvement-and-new-binaries

A equipe ggml-org publicou o llama.cpp b11499 em 8 de outubro de 2026. A atualização altera o backend CUDA para usar strides em bytes na operação roll, permitindo que a GPU processe corretamente dados não contíguos. A versão também inclui novos binários para Apple Silicon, macOS com processadores Intel, iOS e várias versões do Ubuntu (CPU, Vulkan e CUDA 12). Todos os arquivos estão disponíveis para download na página da versão no GitHub.

## Os fatos

- A versão b11499 foi publicada em 2026-10-08
- O backend CUDA agora oferece suporte a operações roll com strides em bytes

## Por que importa

Desenvolvedores podem executar o llama.cpp em mais configurações de GPU sem erros, ampliando o uso local de LLMs em desktops e servidores.

## Fontes e referências

1. [ggml-org/llama.cpp b11499](https://github.com/ggml-org/llama.cpp/releases/tag/b11499) – llama.cpp, 2026-10-08

Última atualização: 2026-10-08
