A equipe ggml-org lançou a versão b11494 do llama.cpp. A atualização altera o backend CUDA para atribuir quatro colunas de estado GDN a cada warp, em vez de duas. Essa configuração passa a ser o padrão. Estão disponíveis para download binários para macOS (Apple Silicon e Intel), iOS e várias versões do Ubuntu.
Por que importa
Desenvolvedores que usam llama.cpp em GPUs NVIDIA podem esperar uma inferência mais rápida sem precisar alterar o código.