Oossa

llama.cpp accélère les prompts GLM sur les GPU Intel Arc

Les nouveautés SYCL multiplient jusqu’à par 3 le débit de tokens sur une Intel Arc Pro B70 et réduisent les transferts mémoire pour l’attention flash.

BrèvePar Publié par Oossa: 1 min de lecture

La bibliothèque llama.cpp a ajouté la prise en charge de SYCL, qui accélère l’attention flash de GLM‑4.7. Sur un GPU Intel Arc Pro B70, la vitesse de préremplissage du prompt pour un contexte de 8192 tokens est passée de 432.80 à 1,292.29 tokens par seconde, soit près de trois fois plus. Un second ajustement stocke les scores intermédiaires en demi-précision (F16) plutôt qu’en simple précision, réduisant le temps de traitement de quelques pourcents tout en diminuant l’utilisation de la mémoire. Les performances des autres charges de travail sont restées inchangées.

Pourquoi c'est important

Les développeurs peuvent exécuter plus rapidement des modèles GLM plus volumineux sur des GPU Intel Arc abordables, ce qui rend les applications d’IA interactives plus réactives.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.