Biblioteket llama.cpp har fått stöd för SYCL, vilket snabbar upp flash attention i GLM‑4.7. På ett Intel Arc Pro B70-grafikkort ökade hastigheten för promptförbearbetning med en kontext på 8192 token från 432.80 till 1,292.29 token per sekund – nästan tre gånger snabbare. En annan justering lagrar mellanliggande poäng med halv precision (F16) i stället för enkel precision, vilket kapar bearbetningstiden med några procent och samtidigt minskar minnesanvändningen. Övriga arbetsbelastningar förblev oförändrade.
Varför det spelar roll
Utvecklare kan köra större GLM-modeller snabbare på prisvärda Intel Arc-grafikkort, vilket gör AI-appar med interaktiva funktioner mer responsiva.