A equipe ggml-org lançou a versão b11398 do llama.cpp. A atualização adiciona suporte ao processamento de dados restantes em BF16, FP16 e FP32 no backend tinyBLAS para CPUs em plataformas x86. As alterações também vetorizam esse processamento para acelerar os cálculos. Há binários pré-compilados para macOS (Apple Silicon e Intel), iOS e várias arquiteturas do Ubuntu. A atualização também inclui ajustes nos testes para garantir comparações precisas com implementações de referência.
Por que importa
Desenvolvedores podem executar inferência de LLMs mais rapidamente em CPUs comuns, sem aceleração por GPU.