Oossa

llama.cpp adiciona kernels CUDA para larguras acima de 512

A versão lançada em 8 de outubro de 2026 inclui novos kernels FWHT rápidos, que suportam larguras de 1.024 a 8.192 em GPUs NVIDIA.

NotaPor Publicado pelo Oossa: 1 min de leitura

O projeto llama.cpp lançou a versão b11482 em 8 de outubro de 2026. Ela adiciona kernels CUDA FWHT compatíveis com larguras de bloco acima de 512, ampliando o suporte para 1.024 a 8.192 em dados FP32 e FP16. A mudança reaproveita a infraestrutura F16 existente e passou nos testes em uma GPU A10. Os kernels existentes para larguras de warp (64 a 512) permanecem inalterados.

Por que importa

Usuários de GPU agora podem executar multiplicações de matrizes com larguras maiores e mais rapidez no llama.cpp.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.