Oossa

llama.cpp snabbar upp GLM-prompter på Intel Arc

De nya SYCL-ändringarna ökar tokengenomströmningen med upp till 3× på ett Intel Arc Pro B70 och minskar minnestrafiken för flash attention.

NotisAv Publicerad av Oossa: 1 min läsning

Biblioteket llama.cpp har fått stöd för SYCL, vilket snabbar upp flash attention i GLM‑4.7. På ett Intel Arc Pro B70-grafikkort ökade hastigheten för promptförbearbetning med en kontext på 8192 token från 432.80 till 1,292.29 token per sekund – nästan tre gånger snabbare. En annan justering lagrar mellanliggande poäng med halv precision (F16) i stället för enkel precision, vilket kapar bearbetningstiden med några procent och samtidigt minskar minnesanvändningen. Övriga arbetsbelastningar förblev oförändrade.

Varför det spelar roll

Utvecklare kan köra större GLM-modeller snabbare på prisvärda Intel Arc-grafikkort, vilket gör AI-appar med interaktiva funktioner mer responsiva.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.