A ggml-org lançou a versão b11555 do llama.cpp. A atualização corrige um erro que fazia CPUs AVX2 não usarem o conjunto de instruções F16C, mesmo quando ele estava disponível. A versão também traz novos pacotes binários para macOS Apple Silicon, macOS Intel, iOS e várias configurações do Ubuntu, incluindo suporte a Vulkan e CUDA 12.8.
Por que importa
Desenvolvedores que executam modelos Llama em CPUs compatíveis terão inferência mais rápida, sem precisar aplicar correções manualmente.