# llama.cpp accélère les prompts GLM sur les GPU Intel Arc

> Les nouveautés SYCL multiplient jusqu’à par 3 le débit de tokens sur une Intel Arc Pro B70 et réduisent les transferts mémoire pour l’attention flash.

Oossa · 2026-10-07 · https://oossa.com/fr/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

La bibliothèque llama.cpp a ajouté la prise en charge de SYCL, qui accélère l’attention flash de GLM‑4.7. Sur un GPU Intel Arc Pro B70, la vitesse de préremplissage du prompt pour un contexte de 8192 tokens est passée de 432.80 à 1,292.29 tokens par seconde, soit près de trois fois plus. Un second ajustement stocke les scores intermédiaires en demi-précision (F16) plutôt qu’en simple précision, réduisant le temps de traitement de quelques pourcents tout en diminuant l’utilisation de la mémoire. Les performances des autres charges de travail sont restées inchangées.

## Les faits

- Le débit de tokens pp8192 est passé de 432.80 à 1,292.29 tok/s (2.99×) sur une Intel Arc Pro B70
- Le stockage des scores d’attention flash en F16 a apporté un gain de 4.6% pour pp8192 (1,583.9 → 1,657.1 tok/s)

## Pourquoi c'est important

Les développeurs peuvent exécuter plus rapidement des modèles GLM plus volumineux sur des GPU Intel Arc abordables, ce qui rend les applications d’IA interactives plus réactives.

## Sources et références

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

Dernière mise à jour: 2026-10-07
