OossaAI utvecklas fort. Vi förklarar det enkelt.

llama.cpp får stöd för AVX512‑FP16 i b11262

Det öppna biblioteket llama.cpp använder nu AVX512‑FP16 för att beräkna skalärprodukter med halv precision i full precision, vilket förbättrar prestandan på processorer.

NotisOossa1 min läsning

Teamet ggml‑org släppte version b11262 av llama.cpp den 29 september 2026. Uppdateringen lägger till stöd för AVX512‑FP16, som beräknar skalärprodukter med halv precision (f16) men summerar resultaten med enkel precision (f32) för bättre noggrannhet. Det är en förändring på låg nivå som snabbar upp inferens på processorer med instruktionsuppsättningen AVX512‑FP16. I versionen ingår också nya binärfiler för macOS, iOS och flera Linux-varianter.

Varför det spelar roll

Det gör att utvecklare kan köra LLM:er snabbare på moderna processorer utan att försämra den numeriska kvaliteten.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.

Källor och referenser

#KällaUtgivareDatumKärnpunkt
1ggml-org/llama.cpp b11262 ↗llama.cpp29 sep. 2026<details open> ggml : accumulate f16 dot products in f32 on AVX512-FP16 (#29545) Supersedes #29530 Signed-off-by: Adrien Gallouët <angt@hugg

1 källor

Senast uppdaterad: ·Markdown·llms.txt