# llama.cpp güncellemesi Intel Arc’ta GLM istemlerini hızlandırıyor

> Yeni SYCL değişiklikleri, Intel Arc Pro B70’te token işleme hızını 3 kata kadar artırırken flash attention’ın bellek trafiğini azaltıyor.

Oossa · 2026-10-07 · https://oossa.com/tr/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

llama.cpp kütüphanesine GLM‑4.7 flash attention’ı hızlandıran SYCL desteği eklendi. Intel Arc Pro B70 GPU’da, 8192 tokenlık bağlam için istem ön işleme hızı saniyede 432.80 tokendan 1,292.29 tokene çıktı; bu, neredeyse 3 katlık bir artış demek. İkinci bir değişiklikle ara skorlar tek duyarlıklı biçim yerine yarı duyarlıklı (F16) biçimde saklanıyor. Bu, bellek kullanımını azaltırken işlem süresini de birkaç puan kısaltıyor. Diğer iş yüklerinde değişiklik olmadı.

## Gerçekler

- Intel Arc Pro B70’te pp8192 token hızı 432.80’den 1,292.29 tok/s’ye yükseldi (2.99×)
- Flash attention skorlarının F16 biçiminde saklanması, pp8192’de %4.6 hız artışı sağladı (1,583.9 → 1,657.1 tok/s)

## Neden önemli

Geliştiriciler, uygun fiyatlı Intel Arc GPU’larda daha büyük GLM modellerini daha hızlı çalıştırarak etkileşimli yapay zekâ uygulamalarını daha duyarlı hâle getirebilir.

## Kaynaklar ve referanslar

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

Son güncelleme: 2026-10-07
