Oossa

llama.cpp acelera a desquantização de pesos Q6_K

A versão b11489 acelera a desquantização de pesos Q6_K e amplia o desenrolamento de operações. Há novos binários para macOS, iOS e Linux.

NotaPor Publicado pelo Oossa: 1 min de leitura

A equipe ggml‑org lançou a versão b11489 do llama.cpp. A atualização acelera a desquantização de pesos Q6_K — etapa que converte pesos de modelos compactados em números utilizáveis — e dobra o fator de desenrolamento, segundo as notas de lançamento. Agora há binários pré-compilados para Apple Silicon, macOS com processadores Intel, iOS e várias configurações do Ubuntu, incluindo versões com Vulkan e CUDA.

Por que importa

A desquantização mais rápida permite que desenvolvedores executem LLMs no mesmo hardware com menor latência.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.