La biblioteca llama.cpp incorporó compatibilidad con SYCL para acelerar flash attention en GLM‑4.7. En una GPU Intel Arc Pro B70, la velocidad de procesamiento inicial del prompt para un contexto de 8192 tokens pasó de 432.80 a 1,292.29 tokens por segundo: casi el triple. Otro ajuste almacena las puntuaciones intermedias en precisión media (F16) en lugar de precisión simple, lo que reduce unos pocos puntos porcentuales el tiempo de procesamiento y también el uso de memoria. El rendimiento de las demás cargas de trabajo no cambió.
Por qué importa
Los desarrolladores pueden ejecutar modelos GLM más grandes y rápido en GPU Intel Arc asequibles, lo que hace que las aplicaciones de IA interactivas respondan mejor.