# Google meldt 2,4× snellere sparse video-aandacht op TPU’s

> Google zegt dat een op tiles afgestemde attention-kernel de latentie op één TPU v6e-chip verlaagde. De gemelde versnelling geldt voor de attention-kernel, niet voor de volledige videogeneratiepipeline.

Oossa · 2026-09-30 · https://oossa.com/nl/google-reports-2-4-faster-sparse-video-attention-on-tpus

Datum van gebeurtenis: 2026-09-30

Gemaakt en vertaald met AI-ondersteuning. Bekijk de oorspronkelijke bronnen hieronder.

Google publiceerde een casestudy over het versnellen van attention bij videodiffusie, een kostbare stap bij het genereren van lange clips met hoge resolutie. De JAX- en Pallas-kernel gebruikt sparse attention en stemt het attention-masker af op de tiles die de TPU verwerkt.

In tests op één TPU v6e-chip duurde de uiteindelijke versie 32.76 milliseconden, tegenover 78.70 milliseconden voor dense Splash attention: een gemelde versnelling van 2.40×. De metingen waren gebaseerd op synthetische invoer en laten routing, het herschikken van tokens en communicatie tussen apparaten buiten beschouwing. Ze tonen dus geen versnelling van de volledige videogeneratiepipeline aan.

## De feiten

- De tests gebruikten 75,600 tokens, 10 heads en een head dimension van 128 op één TPU v6e-chip.
- Google meldde 32.76 ms voor de uiteindelijke sparse kernel en 78.70 ms voor dense Splash attention.

## Waarom het ertoe doet

Voor teams die videogeneratie op TPU’s optimaliseren, laat het resultaat zien dat een sparse masker trager kan zijn dan dense attention, tenzij de kernel zo is ontworpen dat die de juiste tiles overslaat en efficiënt verwerkt. De bron toont niet wat het effect is op de totale videogeneratietijd.

## Bronnen en referenties

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

Laatst bijgewerkt: 2026-09-30
