# Google: 2,4 gånger snabbare gles videoattention på TPU

> Google uppger att en tile-anpassad attention-kernel sänkte latensen på ett TPU v6e-chip. Den rapporterade hastighetsökningen gäller attention-kerneln, inte hela videgenereringsflödet.

Oossa · 2026-09-30 · https://oossa.com/sv/google-reports-2-4-faster-sparse-video-attention-on-tpus

Händelsedatum: 2026-09-30

Producerad och översatt med AI-stöd. Kontrollera originalkällorna nedan.

Google har publicerat en fallstudie om hur attention i videodiffusion kan snabbas upp – ett beräkningstungt steg när långa videoklipp med hög upplösning genereras. Kärnan, som bygger på JAX och Pallas, använder gles attention och anpassar attention-masken efter de tiles som TPU:n beräknar.

I tester på ett TPU v6e-chip tog den slutliga versionen 32,76 millisekunder, jämfört med 78,70 millisekunder för tät Splash-attention – en rapporterad hastighetsökning på 2,40 gånger. Mätningarna använde syntetiska indata och omfattar inte routning, omordning av tokens eller kommunikation mellan enheter. De visar därför inte att videgenerering som helhet blir snabbare.

## Fakta

- Testerna använde 75 600 tokens, 10 huvuden och en head-dimension på 128 på ett TPU v6e-chip.
- Google rapporterade 32,76 ms för sin slutliga glesa kernel och 78,70 ms för tät Splash-attention.

## Varför det spelar roll

För team som optimerar videogenerering på TPU visar resultatet att en gles mask kan vara långsammare än tät attention om kerneln inte utformas för att hoppa över och effektivt bearbeta rätt tiles. Källan visar inte vilken effekt detta får på den totala tiden för videgenerering.

## Källor och referenser

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

Senast uppdaterad: 2026-09-30
