Onderzoekers onder leiding van Kai Ding hebben WAM-Cache uitgebracht, een framework dat key-value-representaties uit een videodiffusiontransformer hergebruikt voor opeenvolgende besturingschunks. In plaats van bij elke stap de volledige visuele encoder opnieuw te berekenen, ververst het systeem alleen een beperkt aantal tokens. Die worden geselecteerd op basis van de aandacht van de actie-expert en een maat voor visuele verrassing, met een strikte maximale leeftijd. Op de Fast-WAM-benchmark verlaagt het de FLOPs van de video-encoder met 32‑42% op RoboTwin 2.0, LIBERO en in tests in de echte wereld. De prestaties blijven daarbij in simulaties binnen 0,7‑1,8 procentpunt van de dense baseline en op een echte robot binnen 2,5 procentpunt.
Waarom het ertoe doet
Roboticaontwikkelaars kunnen krachtige manipulatiebeleidssystemen op goedkopere hardware draaien, zonder dat het slagingspercentage sterk terugloopt.