A equipe ggml-org lançou a versão b11487 do llama.cpp. A atualização adiciona suporte a GET_ROWS para Q4_K e Q6_K em blocos nos processadores Hexagon e aprimora o tratamento de visualizações Q4_K. Há binários pré-compilados para Apple Silicon, Macs com Intel, iOS e várias versões do Ubuntu (CPU e Vulkan). A atualização está disponível para download na página de lançamentos do GitHub.
Por que importa
Desenvolvedores agora podem executar modelos Llama com mais eficiência em dispositivos baseados em Hexagon, como os que usam chips Qualcomm, melhorando o desempenho em hardware móvel e embarcado compatível.