O Google publicou um estudo de caso sobre como acelerar a atenção em modelos de difusão de vídeo, uma etapa custosa na geração de clipes longos e em alta resolução. O kernel, desenvolvido com JAX e Pallas, usa atenção esparsa e alinha a máscara de atenção aos blocos processados pela TPU.
Nos testes em um único chip TPU v6e, a versão final levou 32.76 milissegundos, ante 78.70 milissegundos da atenção densa Splash — um ganho de velocidade informado de 2.40×. As medições usaram entradas sintéticas e não incluem roteamento, reorganização de tokens nem comunicação entre dispositivos; portanto, não demonstram um ganho de velocidade de ponta a ponta na geração de vídeo.
Por que importa
Para equipes que otimizam a geração de vídeo em TPUs, o resultado mostra que uma máscara esparsa pode ser mais lenta que a atenção densa se o kernel não for projetado para pular os blocos certos e processá-los com eficiência. A fonte não mostra o impacto no tempo total de geração de vídeo.