A biblioteca llama.cpp ganhou suporte a SYCL que acelera a atenção flash do GLM‑4.7. Na GPU Intel Arc Pro B70, a velocidade de pré-processamento do prompt para um contexto de 8192 tokens subiu de 432.80 para 1,292.29 tokens por segundo — quase três vezes mais rápida. Um segundo ajuste armazena as pontuações intermediárias em meia precisão (F16), em vez de precisão simples, reduzindo o tempo de processamento em alguns pontos percentuais e o uso de memória. O desempenho em outras cargas de trabalho permaneceu igual.
Por que importa
Desenvolvedores podem executar modelos GLM maiores e mais rápido em GPUs Intel Arc acessíveis, deixando aplicativos de IA interativos mais responsivos.