Oossa

Google: разреженное внимание к видео на TPU работает в 2,4 раза быстрее

По данным Google, ядро внимания, выровненное по тайлам, снизило задержку на одном чипе TPU v6e. Заявленное ускорение относится к ядру внимания, а не ко всему процессу генерации видео.

ЗаметкаOossaОпубликовано Oossa: 1 мин чтения

Google опубликовала разбор оптимизации механизма внимания в видеодиффузионных моделях — затратного этапа при создании длинных роликов высокого разрешения. Ядро на JAX и Pallas использует разреженное внимание и выравнивает маску внимания по тайлам, которые вычисляет TPU.

В тестах на одном чипе TPU v6e финальная версия работала 32.76 миллисекунды против 78.70 миллисекунды у плотного внимания Splash — заявленное ускорение составило 2.40 раза. Измерения проводились на синтетических входных данных и не учитывали маршрутизацию, перестановку токенов и обмен данными между устройствами, поэтому они не подтверждают ускорение генерации видео в целом.

Почему это важно

Для команд, оптимизирующих генерацию видео на TPU, этот результат показывает: разреженная маска может работать медленнее плотного внимания, если ядро не умеет пропускать ненужные тайлы и эффективно обрабатывать нужные. В источнике не приводятся данные о влиянии оптимизации на общее время генерации видео.

Источники и ссылки

1 источников
  1. Google for DevelopersЧитать первоисточник

Обновлено: ·Markdown

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.