Oossa

llama.cpp b11510 amplia o suporte a tensores CUDA

A biblioteca open source de inferência LLaMA chega à versão b11510 com um novo kernel CUDA que processa mais de 65.535 linhas, além de binários para macOS, iOS e Linux.

NotaPor Publicado pelo Oossa: 1 min de leitura

A equipe ggml-org publicou o llama.cpp versão b11510 em 8 de outubro de 2026. A atualização adiciona um kernel PAD em loop para CUDA, permitindo que a biblioteca processe tensores com mais de 65.000 linhas ou fatias. A versão também inclui binários pré-compilados para Apple Silicon, macOS com Intel, iOS e várias versões do Ubuntu (CPU, Vulkan e CUDA 12.8). O código e as atestações estão disponíveis na página do GitHub.

Por que importa

Desenvolvedores agora podem executar modelos de linguagem maiores em GPUs NVIDIA sem esbarrar no limite anterior de linhas.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.