# llama.cpp adiciona kernels CUDA para larguras acima de 512

> A versão lançada em 8 de outubro de 2026 inclui novos kernels FWHT rápidos, que suportam larguras de 1.024 a 8.192 em GPUs NVIDIA.

Oossa · 2026-10-08 · https://oossa.com/pt/llama-cpp-adds-cuda-kernels-for-block-widths-over-512

O projeto llama.cpp lançou a versão b11482 em 8 de outubro de 2026. Ela adiciona kernels CUDA FWHT compatíveis com larguras de bloco acima de 512, ampliando o suporte para 1.024 a 8.192 em dados FP32 e FP16. A mudança reaproveita a infraestrutura F16 existente e passou nos testes em uma GPU A10. Os kernels existentes para larguras de warp (64 a 512) permanecem inalterados.

## Os fatos

- Tag da versão b11482, publicada em 8 de outubro de 2026
- Os novos kernels oferecem suporte a larguras de 1.024 a 8.192 para FP32 e FP16

## Por que importa

Usuários de GPU agora podem executar multiplicações de matrizes com larguras maiores e mais rapidez no llama.cpp.

## Fontes e referências

1. [ggml-org/llama.cpp b11482](https://github.com/ggml-org/llama.cpp/releases/tag/b11482) – llama.cpp, 2026-10-08

Última atualização: 2026-10-08
