Google har publicerat en fallstudie om hur attention i videodiffusion kan snabbas upp – ett beräkningstungt steg när långa videoklipp med hög upplösning genereras. Kärnan, som bygger på JAX och Pallas, använder gles attention och anpassar attention-masken efter de tiles som TPU:n beräknar.
I tester på ett TPU v6e-chip tog den slutliga versionen 32,76 millisekunder, jämfört med 78,70 millisekunder för tät Splash-attention – en rapporterad hastighetsökning på 2,40 gånger. Mätningarna använde syntetiska indata och omfattar inte routning, omordning av tokens eller kommunikation mellan enheter. De visar därför inte att videgenerering som helhet blir snabbare.
Varför det spelar roll
För team som optimerar videogenerering på TPU visar resultatet att en gles mask kan vara långsammare än tät attention om kerneln inte utformas för att hoppa över och effektivt bearbeta rätt tiles. Källan visar inte vilken effekt detta får på den totala tiden för videgenerering.