Het ggml-org-team heeft op 29 september 2026 versie b11262 van llama.cpp uitgebracht. De update voegt ondersteuning voor AVX512-FP16 toe. Daarmee worden dotproducten met halve precisie (f16) berekend en worden de resultaten opgeteld in enkelvoudige precisie (f32), voor een hogere nauwkeurigheid. Deze wijziging op laag niveau versnelt inferentie op CPU’s met de AVX512-FP16-instructieset. De release bevat ook nieuwe binaries voor macOS, iOS en verschillende Linux-builds.
Waarom het ertoe doet
Ontwikkelaars kunnen hiermee LLM’s sneller uitvoeren op moderne CPU’s zonder aan numerieke kwaliteit in te boeten.