# Google logra atención dispersa de video 2,4 veces más rápida en TPU

> Google afirma que un kernel de atención alineado con los bloques redujo la latencia en un chip TPU v6e. La mejora informada corresponde al kernel de atención, no a toda la canalización de generación de video.

Oossa · 2026-09-30 · https://oossa.com/es/google-reports-2-4-faster-sparse-video-attention-on-tpus

Fecha del evento: 2026-09-30

Creado y traducido con ayuda de IA. Consulta las fuentes originales abajo.

Google publicó un caso de estudio sobre cómo acelerar la atención en la difusión de video, una etapa costosa al generar clips largos y de alta resolución. Su kernel en JAX y Pallas utiliza atención dispersa y alinea la máscara de atención con los bloques que procesa la TPU.

En las pruebas realizadas con un solo chip TPU v6e, la versión final tardó 32.76 milisegundos, frente a los 78.70 milisegundos de la atención densa Splash: una aceleración informada de 2.40×. Las mediciones utilizaron entradas sintéticas y excluyen el enrutamiento, la reorganización de tokens y la comunicación entre dispositivos, por lo que no demuestran una mejora de velocidad de principio a fin en la generación de video.

## Los hechos

- Las pruebas utilizaron 75,600 tokens, 10 cabezales y una dimensión de cabezal de 128 en un solo chip TPU v6e.
- Google informó 32.76 ms para su kernel disperso final y 78.70 ms para la atención densa Splash.

## Por qué importa

Para los equipos que optimizan la generación de video en TPU, el resultado muestra que una máscara dispersa puede ser más lenta que la atención densa si el kernel no está diseñado para omitir y procesar eficientemente los bloques adecuados; la fuente no muestra el impacto en el tiempo total de generación de video.

## Fuentes y referencias

1. [Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs](https://developers.googleblog.com/en/accelerating-spatio-temporal-attention-for-video-diffusion-on-tpus/) – Google for Developers

Última actualización: 2026-09-30
