Oossa

Google: attenzione video sparsa 2,4× più veloce sulle TPU

Google afferma che un kernel di attenzione allineato ai tile ha ridotto la latenza su un singolo chip TPU v6e. Il miglioramento dichiarato riguarda il kernel di attenzione, non l’intera pipeline di generazione video.

BreveOossaPubblicato da Oossa: 1 min di lettura

Google ha pubblicato un caso di studio su come accelerare l’attenzione nei modelli di diffusione video, una fase onerosa nella generazione di clip lunghe e ad alta risoluzione. Il kernel, realizzato con JAX e Pallas, usa l’attenzione sparsa e allinea la maschera di attenzione ai tile elaborati dalla TPU.

Nei test su un singolo chip TPU v6e, la versione finale ha impiegato 32.76 millisecondi, contro i 78.70 millisecondi dell’attenzione densa Splash: un’accelerazione dichiarata di 2.40×. Le misurazioni hanno usato input sintetici ed escludono il routing, il riordinamento dei token e la comunicazione tra dispositivi; non dimostrano quindi un’accelerazione dell’intero processo di generazione video.

Perché conta

Per i team che ottimizzano la generazione video sulle TPU, il risultato mostra che una maschera sparsa può essere più lenta dell’attenzione densa se il kernel non è progettato per saltare i tile giusti ed elaborarli in modo efficiente. La fonte non indica l’impatto sui tempi complessivi di generazione video.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.