# Atualização do llama.cpp acelera prompts GLM em GPUs Intel Arc

> As novas mudanças no SYCL elevam em até 3× a velocidade de processamento de tokens na Intel Arc Pro B70 e reduzem o tráfego de memória na atenção flash.

Oossa · 2026-10-07 · https://oossa.com/pt/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

A biblioteca llama.cpp ganhou suporte a SYCL que acelera a atenção flash do GLM‑4.7. Na GPU Intel Arc Pro B70, a velocidade de pré-processamento do prompt para um contexto de 8192 tokens subiu de 432.80 para 1,292.29 tokens por segundo — quase três vezes mais rápida. Um segundo ajuste armazena as pontuações intermediárias em meia precisão (F16), em vez de precisão simples, reduzindo o tempo de processamento em alguns pontos percentuais e o uso de memória. O desempenho em outras cargas de trabalho permaneceu igual.

## Os fatos

- A taxa de processamento de tokens em pp8192 subiu de 432.80 para 1,292.29 tok/s (2.99×) na Intel Arc Pro B70
- Armazenar as pontuações da atenção flash em F16 aumentou o desempenho em 4.6% em pp8192 (1,583.9 → 1,657.1 tok/s)

## Por que importa

Desenvolvedores podem executar modelos GLM maiores e mais rápido em GPUs Intel Arc acessíveis, deixando aplicativos de IA interativos mais responsivos.

## Fontes e referências

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

Última atualização: 2026-10-07
