Oossa

llama.cpp b11499 corrige operação CUDA e traz novos binários

O runtime de LLM de código aberto llama.cpp lançou a versão b11499 em 8 de outubro de 2026, com uma correção de CUDA para operações roll em dados não contíguos e novos binários pré-compilados para macOS, iOS e Linux.

NotaPor Publicado pelo Oossa: 1 min de leitura

A equipe ggml-org publicou o llama.cpp b11499 em 8 de outubro de 2026. A atualização altera o backend CUDA para usar strides em bytes na operação roll, permitindo que a GPU processe corretamente dados não contíguos. A versão também inclui novos binários para Apple Silicon, macOS com processadores Intel, iOS e várias versões do Ubuntu (CPU, Vulkan e CUDA 12). Todos os arquivos estão disponíveis para download na página da versão no GitHub.

Por que importa

Desenvolvedores podem executar o llama.cpp em mais configurações de GPU sem erros, ampliando o uso local de LLMs em desktops e servidores.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.