A equipe ggml-org lançou a versão b11324 do llama.cpp. A atualização adiciona um modo de mapeamento de memória que evita criar uma segunda cópia, do mesmo tamanho, de cada tensor ao carregar modelos. A mudança está disponível em novos pacotes binários para macOS (Apple Silicon e Intel), iOS e várias versões do Ubuntu. O lançamento também registra contribuições de Claude e de Pranesh Gonegandla, engenheiro da NVIDIA.
Por que importa
Desenvolvedores podem executar modelos de linguagem maiores no mesmo hardware, o que ajuda entusiastas e equipes pequenas com memória limitada.