# WAM-Cache reduce hasta un 42% el cómputo visual de robots

> La nueva caché, que no requiere entrenamiento, reduce el costo de los modelos de video y mantiene la precisión en manipulación a pocos puntos del nivel original.

Oossa · 2026-10-09 · https://oossa.com/es/wam-cache-cuts-robot-vision-compute-by-up-to-42

Investigadores dirigidos por Kai Ding presentaron WAM-Cache, un sistema que reutiliza representaciones de clave y valor de un transformador de difusión de video entre bloques de control. En vez de volver a calcular todo el codificador visual en cada paso, el sistema actualiza solo un conjunto disperso de tokens, seleccionados según la atención del experto en acciones y una medida de sorpresa visual, con un límite estricto de antigüedad. En el benchmark Fast-WAM, reduce entre un 32% y un 42% las operaciones de punto flotante (FLOPs) del codificador de video en RoboTwin 2.0, LIBERO y pruebas en el mundo real, con una diferencia de entre 0,7 y 1,8 puntos porcentuales respecto del modelo de referencia completo en simulación, y de 2,5 puntos en un robot real.

## Los hechos

- WAM-Cache reduce entre un 32% y un 42% los FLOPs de prellenado del DiT de video (benchmark Fast-WAM).
- La pérdida de precisión es de como máximo un 1,8% en simulación y un 2,5% en un robot real.

## Por qué importa

Los desarrolladores de robótica pueden ejecutar políticas de manipulación de alto rendimiento en hardware más económico sin una gran caída en las tasas de éxito.

## Fuentes y referencias

1. [WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models](https://arxiv.org/abs/2610.11401) – arXiv cs.RO, 2026-10-09

Última actualización: 2026-10-09
