# Google、TPUで動画のスパース注意処理を2.4倍高速化

> Googleによると、タイルに合わせた注意カーネルにより、TPU v6e 1チップでレイテンシが短縮した。報告された高速化は注意カーネルに限られ、動画生成パイプライン全体のものではない。

Oossa · 2026-09-30 · https://oossa.com/ja/google-reports-2-4-faster-sparse-video-attention-on-tpus

出来事の日付: 2026-09-30

AIの支援で作成・翻訳しています。以下の原典をご確認ください。

Googleは、長尺・高解像度動画の生成で計算負荷の高い工程である、動画拡散モデルの注意処理を高速化する事例を公開した。同社のJAXおよびPallasカーネルはスパース注意を利用し、注意マスクをTPUが計算するタイルに合わせている。

TPU v6e 1チップでのテストでは、最終版の処理時間は32.76ミリ秒で、密なSplash注意処理の78.70ミリ秒に対し、報告された高速化率は2.40倍だった。測定には合成入力を使用し、ルーティング、トークンの並べ替え、デバイス間通信は含まれていないため、動画生成全体の高速化を示すものではない。

## 事実

- テストでは、TPU v6e 1チップで75,600トークン、10ヘッド、ヘッド次元128を使用した。
- Googleが報告した処理時間は、最終版のスパースカーネルが32.76ミリ秒、密なSplash注意処理が78.70ミリ秒。

## なぜ重要か

TPUで動画生成を最適化するチームにとって、この結果は、適切なタイルをスキップし効率よく処理するようカーネルを設計しなければ、スパースマスクが密な注意処理より遅くなる場合があることを示している。元資料では、動画生成全体の所要時間への影響は示されていない。

## 出典と参考資料

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

最終更新: 2026-09-30
