# Google relata atenção esparsa em vídeo 2,4× mais rápida em TPUs

> Segundo o Google, um kernel de atenção alinhado aos blocos reduziu a latência em um chip TPU v6e. O ganho de velocidade informado se refere ao kernel de atenção, não a todo o processo de geração de vídeo.

Oossa · 2026-09-30 · https://oossa.com/pt/google-reports-2-4-faster-sparse-video-attention-on-tpus

Data do evento: 2026-09-30

Produzido e traduzido com auxílio de IA. Consulte as fontes originais abaixo.

O Google publicou um estudo de caso sobre como acelerar a atenção em modelos de difusão de vídeo, uma etapa custosa na geração de clipes longos e em alta resolução. O kernel, desenvolvido com JAX e Pallas, usa atenção esparsa e alinha a máscara de atenção aos blocos processados pela TPU.

Nos testes em um único chip TPU v6e, a versão final levou 32.76 milissegundos, ante 78.70 milissegundos da atenção densa Splash — um ganho de velocidade informado de 2.40×. As medições usaram entradas sintéticas e não incluem roteamento, reorganização de tokens nem comunicação entre dispositivos; portanto, não demonstram um ganho de velocidade de ponta a ponta na geração de vídeo.

## Os fatos

- Os testes usaram 75,600 tokens, 10 cabeças e dimensão de cabeça de 128 em um único chip TPU v6e.
- O Google informou 32.76 ms para seu kernel esparso final e 78.70 ms para a atenção densa Splash.

## Por que importa

Para equipes que otimizam a geração de vídeo em TPUs, o resultado mostra que uma máscara esparsa pode ser mais lenta que a atenção densa se o kernel não for projetado para pular os blocos certos e processá-los com eficiência. A fonte não mostra o impacto no tempo total de geração de vídeo.

## Fontes e referências

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

Última atualização: 2026-09-30
