# Google का दावा: TPU पर sparse video attention 2.4× तेज़

> Google का कहना है कि tiles के साथ संरेखित attention kernel ने एक TPU v6e chip पर latency घटाई। बताई गई तेज़ी सिर्फ attention kernel की है, पूरे video-generation pipeline की नहीं।

Oossa · 2026-09-30 · https://oossa.com/hi/google-reports-2-4-faster-sparse-video-attention-on-tpus

घटना की तारीख: 2026-09-30

AI की सहायता से तैयार और अनुवादित। नीचे मूल स्रोत देखें।

Google ने लंबे और हाई-रेज़ॉल्यूशन वाले वीडियो क्लिप बनाने में लगने वाले महंगे चरण—video-diffusion attention—को तेज़ करने पर एक case study प्रकाशित की। इसका JAX और Pallas kernel sparse attention का इस्तेमाल करता है और attention mask को TPU द्वारा compute किए जाने वाले tiles के साथ संरेखित करता है।

एक TPU v6e chip पर किए गए परीक्षणों में अंतिम version को 32.76 milliseconds लगे, जबकि dense Splash attention को 78.70 milliseconds लगे—यानी बताई गई तेज़ी 2.40× रही। माप synthetic inputs पर किए गए और इनमें routing, token rearrangement तथा devices के बीच communication शामिल नहीं हैं। इसलिए इनसे end-to-end video generation में तेज़ी साबित नहीं होती।

## तथ्य

- परीक्षणों में एक TPU v6e chip पर 75,600 tokens, 10 heads और 128 की head dimension का इस्तेमाल किया गया।
- Google ने अपने अंतिम sparse kernel के लिए 32.76 ms और dense Splash attention के लिए 78.70 ms का समय बताया।

## यह क्यों मायने रखता है

TPU पर video generation को बेहतर बनाने वाली टीमों के लिए यह नतीजा दिखाता है कि sparse mask, dense attention से धीमा हो सकता है—जब तक kernel को सही tiles छोड़ने और बाकी tiles को कुशलता से process करने के लिए डिज़ाइन न किया जाए। स्रोत यह नहीं बताता कि इससे video generation के कुल समय पर क्या असर पड़ता है।

## स्रोत और संदर्भ

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

अंतिम अपडेट: 2026-09-30
