A equipe ggml‑org lançou a versão b11489 do llama.cpp. A atualização acelera a desquantização de pesos Q6_K — etapa que converte pesos de modelos compactados em números utilizáveis — e dobra o fator de desenrolamento, segundo as notas de lançamento. Agora há binários pré-compilados para Apple Silicon, macOS com processadores Intel, iOS e várias configurações do Ubuntu, incluindo versões com Vulkan e CUDA.
Por que importa
A desquantização mais rápida permite que desenvolvedores executem LLMs no mesmo hardware com menor latência.