# llama.cpp b11510 amplia o suporte a tensores CUDA

> A biblioteca open source de inferência LLaMA chega à versão b11510 com um novo kernel CUDA que processa mais de 65.535 linhas, além de binários para macOS, iOS e Linux.

Oossa · 2026-10-08 · https://oossa.com/pt/llama-cpp-b11510-adds-cuda-support-for-larger-tensors

A equipe ggml-org publicou o llama.cpp versão b11510 em 8 de outubro de 2026. A atualização adiciona um kernel PAD em loop para CUDA, permitindo que a biblioteca processe tensores com mais de 65.000 linhas ou fatias. A versão também inclui binários pré-compilados para Apple Silicon, macOS com Intel, iOS e várias versões do Ubuntu (CPU, Vulkan e CUDA 12.8). O código e as atestações estão disponíveis na página do GitHub.

## Os fatos

- Versão b11510 lançada em 2026-10-08
- Novo kernel PAD para CUDA oferece suporte a mais de 65.535 linhas

## Por que importa

Desenvolvedores agora podem executar modelos de linguagem maiores em GPUs NVIDIA sem esbarrar no limite anterior de linhas.

## Fontes e referências

1. [ggml-org/llama.cpp b11510](https://github.com/ggml-org/llama.cpp/releases/tag/b11510) – llama.cpp, 2026-10-08

Última atualização: 2026-10-08
