Teamet bakom ggml-org har släppt llama.cpp version b11398. Uppdateringen lägger till stöd för BF16-, FP16- och FP32-svanshantering i tinyBLAS CPU-backend på x86-plattformar. Svansarna vektoriseras också för snabbare beräkningar. Färdigbyggda binärfiler finns för macOS (Apple Silicon och Intel), iOS och flera Ubuntu-arkitekturer. Uppdateringen innehåller även justeringar av testerna för att säkerställa korrekta jämförelser med referensimplementationer.
Varför det spelar roll
Utvecklare kan nu köra inferens med stora språkmodeller snabbare på vanliga processorer, utan GPU-acceleration.