# llama.cpp acelera los prompts de GLM en GPU Intel Arc

> Los nuevos cambios de SYCL multiplican hasta por 3 la velocidad de procesamiento de tokens en una Intel Arc Pro B70 y reducen el tráfico de memoria de flash attention.

Oossa · 2026-10-07 · https://oossa.com/es/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

La biblioteca llama.cpp incorporó compatibilidad con SYCL para acelerar flash attention en GLM‑4.7. En una GPU Intel Arc Pro B70, la velocidad de procesamiento inicial del prompt para un contexto de 8192 tokens pasó de 432.80 a 1,292.29 tokens por segundo: casi el triple. Otro ajuste almacena las puntuaciones intermedias en precisión media (F16) en lugar de precisión simple, lo que reduce unos pocos puntos porcentuales el tiempo de procesamiento y también el uso de memoria. El rendimiento de las demás cargas de trabajo no cambió.

## Los hechos

- La velocidad de procesamiento de tokens en pp8192 subió de 432.80 a 1,292.29 tok/s (2.99×) en una Intel Arc Pro B70
- Almacenar las puntuaciones de flash attention en F16 mejoró un 4.6% el rendimiento en pp8192 (1,583.9 → 1,657.1 tok/s)

## Por qué importa

Los desarrolladores pueden ejecutar modelos GLM más grandes y rápido en GPU Intel Arc asequibles, lo que hace que las aplicaciones de IA interactivas respondan mejor.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

Última actualización: 2026-10-07
