Google a publié une étude de cas sur l’accélération de l’attention dans la diffusion vidéo, une étape coûteuse pour générer des clips longs en haute résolution. Son noyau JAX et Pallas utilise l’attention clairsemée et aligne le masque d’attention sur les tuiles calculées par le TPU.
Lors des tests sur une seule puce TPU v6e, la version finale a mis 32,76 millisecondes, contre 78,70 millisecondes pour l’attention dense Splash, soit une accélération annoncée de 2,40 fois. Les mesures reposaient sur des entrées synthétiques et excluent le routage, le réagencement des jetons et les communications entre appareils ; elles ne démontrent donc pas une accélération de bout en bout de la génération vidéo.
Pourquoi c'est important
Pour les équipes qui optimisent la génération vidéo sur TPU, ce résultat montre qu’un masque clairsemé peut être plus lent que l’attention dense si le noyau n’est pas conçu pour ignorer les bonnes tuiles et les traiter efficacement. La source ne montre pas l’effet sur la durée totale de génération vidéo.