Oossa

llama.cpp b11494 otimiza o uso de warps CUDA

A biblioteca de código aberto llama.cpp passa a usar quatro colunas de estado GDN por warp CUDA, melhorando o desempenho na GPU.

NotaPor Publicado pelo Oossa: 1 min de leitura

A equipe ggml-org lançou a versão b11494 do llama.cpp. A atualização altera o backend CUDA para atribuir quatro colunas de estado GDN a cada warp, em vez de duas. Essa configuração passa a ser o padrão. Estão disponíveis para download binários para macOS (Apple Silicon e Intel), iOS e várias versões do Ubuntu.

Por que importa

Desenvolvedores que usam llama.cpp em GPUs NVIDIA podem esperar uma inferência mais rápida sem precisar alterar o código.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.