Het ggml-org-team heeft llama.cpp versie b11398 uitgebracht. Die voegt ondersteuning toe voor BF16-, FP16- en FP32-restverwerking in de tinyBLAS-cpu-backend op x86-platforms. De verwerking is ook gevectoriseerd, zodat berekeningen sneller verlopen. Er zijn vooraf gebouwde binaries beschikbaar voor macOS (Apple Silicon en Intel), iOS en verschillende Ubuntu-architecturen. De update bevat aanpassingen aan tests om nauwkeurige vergelijkingen met referentie-implementaties te garanderen.
Waarom het ertoe doet
Ontwikkelaars kunnen nu sneller LLM-inferentie uitvoeren op gewone cpu’s, zonder GPU-versnelling.