# Google annonce une attention vidéo clairsemée 2,4 fois plus rapide sur TPU

> Selon Google, un noyau d’attention aligné sur les tuiles a réduit la latence sur une puce TPU v6e. Le gain annoncé concerne le noyau d’attention, et non l’ensemble du pipeline de génération vidéo.

Oossa · 2026-09-30 · https://oossa.com/fr/google-reports-2-4-faster-sparse-video-attention-on-tpus

Date de l’événement: 2026-09-30

Créé et traduit avec l’aide de l’IA. Consultez les sources originales ci-dessous.

Google a publié une étude de cas sur l’accélération de l’attention dans la diffusion vidéo, une étape coûteuse pour générer des clips longs en haute résolution. Son noyau JAX et Pallas utilise l’attention clairsemée et aligne le masque d’attention sur les tuiles calculées par le TPU.

Lors des tests sur une seule puce TPU v6e, la version finale a mis 32,76 millisecondes, contre 78,70 millisecondes pour l’attention dense Splash, soit une accélération annoncée de 2,40 fois. Les mesures reposaient sur des entrées synthétiques et excluent le routage, le réagencement des jetons et les communications entre appareils ; elles ne démontrent donc pas une accélération de bout en bout de la génération vidéo.

## Les faits

- Les tests portaient sur 75 600 jetons, 10 têtes et une dimension de tête de 128, sur une seule puce TPU v6e.
- Google a annoncé un temps de 32,76 ms pour son noyau clairsemé final et de 78,70 ms pour l’attention dense Splash.

## Pourquoi c'est important

Pour les équipes qui optimisent la génération vidéo sur TPU, ce résultat montre qu’un masque clairsemé peut être plus lent que l’attention dense si le noyau n’est pas conçu pour ignorer les bonnes tuiles et les traiter efficacement. La source ne montre pas l’effet sur la durée totale de génération vidéo.

## Sources et références

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

Dernière mise à jour: 2026-09-30
