Googleは、長尺・高解像度動画の生成で計算負荷の高い工程である、動画拡散モデルの注意処理を高速化する事例を公開した。同社のJAXおよびPallasカーネルはスパース注意を利用し、注意マスクをTPUが計算するタイルに合わせている。
TPU v6e 1チップでのテストでは、最終版の処理時間は32.76ミリ秒で、密なSplash注意処理の78.70ミリ秒に対し、報告された高速化率は2.40倍だった。測定には合成入力を使用し、ルーティング、トークンの並べ替え、デバイス間通信は含まれていないため、動画生成全体の高速化を示すものではない。
なぜ重要か
TPUで動画生成を最適化するチームにとって、この結果は、適切なタイルをスキップし効率よく処理するようカーネルを設計しなければ、スパースマスクが密な注意処理より遅くなる場合があることを示している。元資料では、動画生成全体の所要時間への影響は示されていない。