# Google: разреженное внимание к видео на TPU работает в 2,4 раза быстрее

> По данным Google, ядро внимания, выровненное по тайлам, снизило задержку на одном чипе TPU v6e. Заявленное ускорение относится к ядру внимания, а не ко всему процессу генерации видео.

Oossa · 2026-09-30 · https://oossa.com/ru/google-reports-2-4-faster-sparse-video-attention-on-tpus

Дата события: 2026-09-30

Создано и переведено с помощью ИИ. Проверьте первоисточники ниже.

Google опубликовала разбор оптимизации механизма внимания в видеодиффузионных моделях — затратного этапа при создании длинных роликов высокого разрешения. Ядро на JAX и Pallas использует разреженное внимание и выравнивает маску внимания по тайлам, которые вычисляет TPU.

В тестах на одном чипе TPU v6e финальная версия работала 32.76 миллисекунды против 78.70 миллисекунды у плотного внимания Splash — заявленное ускорение составило 2.40 раза. Измерения проводились на синтетических входных данных и не учитывали маршрутизацию, перестановку токенов и обмен данными между устройствами, поэтому они не подтверждают ускорение генерации видео в целом.

## Факты

- В тестах использовались 75,600 токенов, 10 голов внимания и размерность головы 128 на одном чипе TPU v6e.
- Google сообщила, что финальное разреженное ядро работало 32.76 ms, а плотное внимание Splash — 78.70 ms.

## Почему это важно

Для команд, оптимизирующих генерацию видео на TPU, этот результат показывает: разреженная маска может работать медленнее плотного внимания, если ядро не умеет пропускать ненужные тайлы и эффективно обрабатывать нужные. В источнике не приводятся данные о влиянии оптимизации на общее время генерации видео.

## Источники и ссылки

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

Обновлено: 2026-09-30
