Oossa

llama.cpp acelera los prompts de GLM en GPU Intel Arc

Los nuevos cambios de SYCL multiplican hasta por 3 la velocidad de procesamiento de tokens en una Intel Arc Pro B70 y reducen el tráfico de memoria de flash attention.

BrevePor Publicado por Oossa: 1 min de lectura

La biblioteca llama.cpp incorporó compatibilidad con SYCL para acelerar flash attention en GLM‑4.7. En una GPU Intel Arc Pro B70, la velocidad de procesamiento inicial del prompt para un contexto de 8192 tokens pasó de 432.80 a 1,292.29 tokens por segundo: casi el triple. Otro ajuste almacena las puntuaciones intermedias en precisión media (F16) en lugar de precisión simple, lo que reduce unos pocos puntos porcentuales el tiempo de procesamiento y también el uso de memoria. El rendimiento de las demás cargas de trabajo no cambió.

Por qué importa

Los desarrolladores pueden ejecutar modelos GLM más grandes y rápido en GPU Intel Arc asequibles, lo que hace que las aplicaciones de IA interactivas respondan mejor.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.