# Google称TPU上的稀疏视频注意力提速2.4倍

> Google表示，按计算分块对齐的注意力内核降低了单颗TPU v6e芯片上的延迟。所报告的提速仅针对注意力内核，并不代表整个视频生成流程都变快。

Oossa · 2026-09-30 · https://oossa.com/zh/google-reports-2-4-faster-sparse-video-attention-on-tpus

事件日期: 2026-09-30

借助 AI 编写和翻译。请核对下方原始来源。

Google发布了一项案例研究，介绍如何加速视频扩散模型中的注意力计算——这是生成长视频、高分辨率视频片段时开销较大的一步。其JAX和Pallas内核采用稀疏注意力，并让注意力掩码与TPU处理数据时使用的计算分块对齐。

在单颗TPU v6e芯片上的测试中，最终版本耗时32.76毫秒，而稠密Splash注意力耗时78.70毫秒；据称速度提升了2.40倍。测试使用合成输入，未计入路由、令牌重排和设备间通信，因此不能证明端到端视频生成速度有所提升。

## 事实

- 测试在单颗TPU v6e芯片上进行，使用了75,600个令牌、10个头，头维度为128。
- Google报告称，其最终稀疏内核耗时32.76毫秒，稠密Splash注意力耗时78.70毫秒。

## 为什么重要

对于在TPU上优化视频生成的团队，这一结果表明，除非内核经过专门设计，能够跳过合适的计算分块并高效处理其余分块，否则稀疏掩码可能比稠密注意力更慢；原文并未说明这会如何影响完整视频生成流程的耗时。

## 来源与参考

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

最后更新: 2026-09-30
