Google ने लंबे और हाई-रेज़ॉल्यूशन वाले वीडियो क्लिप बनाने में लगने वाले महंगे चरण—video-diffusion attention—को तेज़ करने पर एक case study प्रकाशित की। इसका JAX और Pallas kernel sparse attention का इस्तेमाल करता है और attention mask को TPU द्वारा compute किए जाने वाले tiles के साथ संरेखित करता है।
एक TPU v6e chip पर किए गए परीक्षणों में अंतिम version को 32.76 milliseconds लगे, जबकि dense Splash attention को 78.70 milliseconds लगे—यानी बताई गई तेज़ी 2.40× रही। माप synthetic inputs पर किए गए और इनमें routing, token rearrangement तथा devices के बीच communication शामिल नहीं हैं। इसलिए इनसे end-to-end video generation में तेज़ी साबित नहीं होती।
यह क्यों मायने रखता है
TPU पर video generation को बेहतर बनाने वाली टीमों के लिए यह नतीजा दिखाता है कि sparse mask, dense attention से धीमा हो सकता है—जब तक kernel को सही tiles छोड़ने और बाकी tiles को कुशलता से process करने के लिए डिज़ाइन न किया जाए। स्रोत यह नहीं बताता कि इससे video generation के कुल समय पर क्या असर पड़ता है।