# WAM-Cache verlaagt rekenwerk voor robotvisie met maximaal 42%

> De nieuwe cache werkt zonder extra training en verlaagt de kosten van videomodellen, terwijl de nauwkeurigheid bij manipulaties hooguit enkele procentpunten daalt.

Oossa · 2026-10-09 · https://oossa.com/nl/wam-cache-cuts-robot-vision-compute-by-up-to-42

Onderzoekers onder leiding van Kai Ding hebben WAM-Cache uitgebracht, een framework dat key-value-representaties uit een videodiffusiontransformer hergebruikt voor opeenvolgende besturingschunks. In plaats van bij elke stap de volledige visuele encoder opnieuw te berekenen, ververst het systeem alleen een beperkt aantal tokens. Die worden geselecteerd op basis van de aandacht van de actie-expert en een maat voor visuele verrassing, met een strikte maximale leeftijd. Op de Fast-WAM-benchmark verlaagt het de FLOPs van de video-encoder met 32‑42% op RoboTwin 2.0, LIBERO en in tests in de echte wereld. De prestaties blijven daarbij in simulaties binnen 0,7‑1,8 procentpunt van de dense baseline en op een echte robot binnen 2,5 procentpunt.

## De feiten

- WAM-Cache verlaagt de prefill-FLOPs van de video-DiT met 32‑42% (Fast-WAM-benchmark).
- Het nauwkeurigheidsverlies bedraagt maximaal 1,8 % in simulaties en 2,5 % op een echte robot.

## Waarom het ertoe doet

Roboticaontwikkelaars kunnen krachtige manipulatiebeleidssystemen op goedkopere hardware draaien, zonder dat het slagingspercentage sterk terugloopt.

## Bronnen en referenties

1. [WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models](https://arxiv.org/abs/2610.11401) – arXiv cs.RO, 2026-10-09

Laatst bijgewerkt: 2026-10-09
