# Google, TPU에서 희소 비디오 어텐션 2.4배 가속

> Google은 타일 정렬 어텐션 커널로 TPU v6e 칩 한 개에서 지연 시간을 줄였다고 밝혔다. 발표된 속도 향상은 어텐션 커널에만 해당하며, 전체 비디오 생성 파이프라인을 대상으로 한 것은 아니다.

Oossa · 2026-09-30 · https://oossa.com/ko/google-reports-2-4-faster-sparse-video-attention-on-tpus

사건 날짜: 2026-09-30

AI의 도움으로 작성하고 번역했습니다. 아래 원본 출처를 확인하세요.

Google은 길고 고해상도인 클립을 생성할 때 비용이 많이 드는 단계인 비디오 확산 모델의 어텐션 속도를 높인 사례를 공개했다. JAX와 Pallas로 구현한 이 커널은 희소 어텐션을 사용하고, 어텐션 마스크를 TPU가 연산하는 타일에 맞춘다.

TPU v6e 칩 한 개에서 테스트한 결과, 최종 버전은 32.76밀리초가 걸렸다. Dense Splash 어텐션의 78.70밀리초와 비교해 2.40배 빨라졌다고 Google은 밝혔다. 합성 입력을 사용한 측정이며 라우팅, 토큰 재배열, 기기 간 통신은 제외했다. 따라서 이 결과만으로 비디오 생성 전체의 속도가 빨라졌다고 볼 수는 없다.

## 팩트

- 테스트는 TPU v6e 칩 한 개에서 토큰 75,600개, 헤드 10개, 헤드 차원 128을 사용했다.
- Google은 최종 희소 커널의 처리 시간으로 32.76 ms, Dense Splash 어텐션의 처리 시간으로 78.70 ms를 보고했다.

## 왜 중요한가

TPU에서 비디오 생성을 최적화하는 팀은 희소 마스크를 사용하더라도 커널이 적절한 타일을 건너뛰고 효율적으로 처리하도록 설계되지 않으면 Dense 어텐션보다 느릴 수 있다는 점을 참고할 수 있다. 원문은 전체 비디오 생성 시간에 미치는 영향은 보여주지 않는다.

## 출처 및 참고 자료

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

최종 업데이트: 2026-09-30
