Oossa

Google logra atención dispersa de video 2,4 veces más rápida en TPU

Google afirma que un kernel de atención alineado con los bloques redujo la latencia en un chip TPU v6e. La mejora informada corresponde al kernel de atención, no a toda la canalización de generación de video.

BreveOossaPublicado por Oossa: 1 min de lectura

Google publicó un caso de estudio sobre cómo acelerar la atención en la difusión de video, una etapa costosa al generar clips largos y de alta resolución. Su kernel en JAX y Pallas utiliza atención dispersa y alinea la máscara de atención con los bloques que procesa la TPU.

En las pruebas realizadas con un solo chip TPU v6e, la versión final tardó 32.76 milisegundos, frente a los 78.70 milisegundos de la atención densa Splash: una aceleración informada de 2.40×. Las mediciones utilizaron entradas sintéticas y excluyen el enrutamiento, la reorganización de tokens y la comunicación entre dispositivos, por lo que no demuestran una mejora de velocidad de principio a fin en la generación de video.

Por qué importa

Para los equipos que optimizan la generación de video en TPU, el resultado muestra que una máscara dispersa puede ser más lenta que la atención densa si el kernel no está diseñado para omitir y procesar eficientemente los bloques adecuados; la fuente no muestra el impacto en el tiempo total de generación de video.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.