Oossa

llama.cpp voegt BF16- en FP16-ondersteuning toe voor x86-cpu’s

De opensourcebibliotheek llama.cpp vectoriseert nu BF16-, FP16- en FP32-restverwerking in de tinyBLAS-backend, waardoor inferentie op cpu’s sneller wordt.

Kort berichtOossaGepubliceerd door Oossa: 1 min lezen

Het ggml-org-team heeft llama.cpp versie b11398 uitgebracht. Die voegt ondersteuning toe voor BF16-, FP16- en FP32-restverwerking in de tinyBLAS-cpu-backend op x86-platforms. De verwerking is ook gevectoriseerd, zodat berekeningen sneller verlopen. Er zijn vooraf gebouwde binaries beschikbaar voor macOS (Apple Silicon en Intel), iOS en verschillende Ubuntu-architecturen. De update bevat aanpassingen aan tests om nauwkeurige vergelijkingen met referentie-implementaties te garanderen.

Waarom het ertoe doet

Ontwikkelaars kunnen nu sneller LLM-inferentie uitvoeren op gewone cpu’s, zonder GPU-versnelling.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.