Oossa

Google meldt 2,4× snellere sparse video-aandacht op TPU’s

Google zegt dat een op tiles afgestemde attention-kernel de latentie op één TPU v6e-chip verlaagde. De gemelde versnelling geldt voor de attention-kernel, niet voor de volledige videogeneratiepipeline.

Kort berichtOossaGepubliceerd door Oossa: 1 min lezen

Google publiceerde een casestudy over het versnellen van attention bij videodiffusie, een kostbare stap bij het genereren van lange clips met hoge resolutie. De JAX- en Pallas-kernel gebruikt sparse attention en stemt het attention-masker af op de tiles die de TPU verwerkt.

In tests op één TPU v6e-chip duurde de uiteindelijke versie 32.76 milliseconden, tegenover 78.70 milliseconden voor dense Splash attention: een gemelde versnelling van 2.40×. De metingen waren gebaseerd op synthetische invoer en laten routing, het herschikken van tokens en communicatie tussen apparaten buiten beschouwing. Ze tonen dus geen versnelling van de volledige videogeneratiepipeline aan.

Waarom het ertoe doet

Voor teams die videogeneratie op TPU’s optimaliseren, laat het resultaat zien dat een sparse masker trager kan zijn dan dense attention, tenzij de kernel zo is ontworpen dat die de juiste tiles overslaat en efficiënt verwerkt. De bron toont niet wat het effect is op de totale videogeneratietijd.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.