llama.cpp kütüphanesine GLM‑4.7 flash attention’ı hızlandıran SYCL desteği eklendi. Intel Arc Pro B70 GPU’da, 8192 tokenlık bağlam için istem ön işleme hızı saniyede 432.80 tokendan 1,292.29 tokene çıktı; bu, neredeyse 3 katlık bir artış demek. İkinci bir değişiklikle ara skorlar tek duyarlıklı biçim yerine yarı duyarlıklı (F16) biçimde saklanıyor. Bu, bellek kullanımını azaltırken işlem süresini de birkaç puan kısaltıyor. Diğer iş yüklerinde değişiklik olmadı.
Neden önemli
Geliştiriciler, uygun fiyatlı Intel Arc GPU’larda daha büyük GLM modellerini daha hızlı çalıştırarak etkileşimli yapay zekâ uygulamalarını daha duyarlı hâle getirebilir.