Oossa

Google का दावा: TPU पर sparse video attention 2.4× तेज़

Google का कहना है कि tiles के साथ संरेखित attention kernel ने एक TPU v6e chip पर latency घटाई। बताई गई तेज़ी सिर्फ attention kernel की है, पूरे video-generation pipeline की नहीं।

संक्षिप्तOossaOossa द्वारा प्रकाशित: 1 मिनट पढ़ना

Google ने लंबे और हाई-रेज़ॉल्यूशन वाले वीडियो क्लिप बनाने में लगने वाले महंगे चरण—video-diffusion attention—को तेज़ करने पर एक case study प्रकाशित की। इसका JAX और Pallas kernel sparse attention का इस्तेमाल करता है और attention mask को TPU द्वारा compute किए जाने वाले tiles के साथ संरेखित करता है।

एक TPU v6e chip पर किए गए परीक्षणों में अंतिम version को 32.76 milliseconds लगे, जबकि dense Splash attention को 78.70 milliseconds लगे—यानी बताई गई तेज़ी 2.40× रही। माप synthetic inputs पर किए गए और इनमें routing, token rearrangement तथा devices के बीच communication शामिल नहीं हैं। इसलिए इनसे end-to-end video generation में तेज़ी साबित नहीं होती।

यह क्यों मायने रखता है

TPU पर video generation को बेहतर बनाने वाली टीमों के लिए यह नतीजा दिखाता है कि sparse mask, dense attention से धीमा हो सकता है—जब तक kernel को सही tiles छोड़ने और बाकी tiles को कुशलता से process करने के लिए डिज़ाइन न किया जाए। स्रोत यह नहीं बताता कि इससे video generation के कुल समय पर क्या असर पड़ता है।

स्रोत और संदर्भ

1 स्रोत
  1. Google for Developersमूल स्रोत पढ़ें

अंतिम अपडेट: ·Markdown

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।