Oossa

Google relata atenção esparsa em vídeo 2,4× mais rápida em TPUs

Segundo o Google, um kernel de atenção alinhado aos blocos reduziu a latência em um chip TPU v6e. O ganho de velocidade informado se refere ao kernel de atenção, não a todo o processo de geração de vídeo.

NotaOossaPublicado pelo Oossa: 1 min de leitura

O Google publicou um estudo de caso sobre como acelerar a atenção em modelos de difusão de vídeo, uma etapa custosa na geração de clipes longos e em alta resolução. O kernel, desenvolvido com JAX e Pallas, usa atenção esparsa e alinha a máscara de atenção aos blocos processados pela TPU.

Nos testes em um único chip TPU v6e, a versão final levou 32.76 milissegundos, ante 78.70 milissegundos da atenção densa Splash — um ganho de velocidade informado de 2.40×. As medições usaram entradas sintéticas e não incluem roteamento, reorganização de tokens nem comunicação entre dispositivos; portanto, não demonstram um ganho de velocidade de ponta a ponta na geração de vídeo.

Por que importa

Para equipes que otimizam a geração de vídeo em TPUs, o resultado mostra que uma máscara esparsa pode ser mais lenta que a atenção densa se o kernel não for projetado para pular os blocos certos e processá-los com eficiência. A fonte não mostra o impacto no tempo total de geração de vídeo.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.