Oossa

llama.cpp v0.1.11534 otimiza cópias CUDA

A biblioteca de inferência LLaMA de código aberto elimina transferências redundantes de memória na GPU, reduzindo a sobrecarga em determinadas cargas de trabalho.

NotaPor Publicado pelo Oossa: 1 min de leitura

A equipe ggml-org lançou a versão b11534 do llama.cpp em 2026-10-09. A atualização incorpora as cópias de snapshots de estado ao cache recorrente e elimina cópias CUDA extras quando K = 1, um caso de decodificação sem especulação. A mudança se limita ao backend CUDA; as versões para CPU e Vulkan não foram alteradas. Há binários pré-compilados para macOS, iOS e várias versões do Ubuntu disponíveis para download.

Quem usa a versão CUDA deve notar uma pequena redução no tráfego de memória da GPU, o que pode melhorar a velocidade em hardware compatível.

Por que importa

A inferência pode ficar mais rápida para usuários de CUDA, porque a biblioteca agora transfere menos dados na GPU.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.