Oossa

llama.cpp güncellemesi Intel Arc’ta GLM istemlerini hızlandırıyor

Yeni SYCL değişiklikleri, Intel Arc Pro B70’te token işleme hızını 3 kata kadar artırırken flash attention’ın bellek trafiğini azaltıyor.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

llama.cpp kütüphanesine GLM‑4.7 flash attention’ı hızlandıran SYCL desteği eklendi. Intel Arc Pro B70 GPU’da, 8192 tokenlık bağlam için istem ön işleme hızı saniyede 432.80 tokendan 1,292.29 tokene çıktı; bu, neredeyse 3 katlık bir artış demek. İkinci bir değişiklikle ara skorlar tek duyarlıklı biçim yerine yarı duyarlıklı (F16) biçimde saklanıyor. Bu, bellek kullanımını azaltırken işlem süresini de birkaç puan kısaltıyor. Diğer iş yüklerinde değişiklik olmadı.

Neden önemli

Geliştiriciler, uygun fiyatlı Intel Arc GPU’larda daha büyük GLM modellerini daha hızlı çalıştırarak etkileşimli yapay zekâ uygulamalarını daha duyarlı hâle getirebilir.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.