# Google: attenzione video sparsa 2,4× più veloce sulle TPU

> Google afferma che un kernel di attenzione allineato ai tile ha ridotto la latenza su un singolo chip TPU v6e. Il miglioramento dichiarato riguarda il kernel di attenzione, non l’intera pipeline di generazione video.

Oossa · 2026-09-30 · https://oossa.com/it/google-reports-2-4-faster-sparse-video-attention-on-tpus

Data dell’evento: 2026-09-30

Prodotto e tradotto con l’aiuto dell’IA. Consulta le fonti originali qui sotto.

Google ha pubblicato un caso di studio su come accelerare l’attenzione nei modelli di diffusione video, una fase onerosa nella generazione di clip lunghe e ad alta risoluzione. Il kernel, realizzato con JAX e Pallas, usa l’attenzione sparsa e allinea la maschera di attenzione ai tile elaborati dalla TPU.

Nei test su un singolo chip TPU v6e, la versione finale ha impiegato 32.76 millisecondi, contro i 78.70 millisecondi dell’attenzione densa Splash: un’accelerazione dichiarata di 2.40×. Le misurazioni hanno usato input sintetici ed escludono il routing, il riordinamento dei token e la comunicazione tra dispositivi; non dimostrano quindi un’accelerazione dell’intero processo di generazione video.

## I fatti

- I test hanno usato 75,600 token, 10 teste e una dimensione della testa pari a 128 su un singolo chip TPU v6e.
- Google ha dichiarato 32.76 ms per il kernel sparso finale e 78.70 ms per l’attenzione densa Splash.

## Perché conta

Per i team che ottimizzano la generazione video sulle TPU, il risultato mostra che una maschera sparsa può essere più lenta dell’attenzione densa se il kernel non è progettato per saltare i tile giusti ed elaborarli in modo efficiente. La fonte non indica l’impatto sui tempi complessivi di generazione video.

## Fonti e riferimenti

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

Ultimo aggiornamento: 2026-09-30
