Ein Forschungsteam unter der Leitung von Kai Ding hat WAM-Cache vorgestellt. Das Framework verwendet Key-Value-Repräsentationen eines Video-Diffusion-Transformers über mehrere Steuerungsabschnitte hinweg erneut. Statt den gesamten visuellen Encoder bei jedem Schritt neu zu berechnen, aktualisiert das System nur eine kleine Auswahl an Tokens. Diese wird anhand der Aufmerksamkeit des Action-Experten und eines Maßes für visuelle Überraschungen bestimmt; außerdem gilt eine strenge Altersgrenze. Im Fast-WAM-Benchmark senkt das Verfahren die FLOPs des Video-Encoders auf RoboTwin 2.0, LIBERO und in Tests in der realen Welt um 32–42 %. In Simulationen liegt die Leistung dabei höchstens 0,7–1,8 Prozentpunkte unter der dichten Referenz; bei einem realen Roboter beträgt der Abstand 2,5 Prozentpunkte.
Warum es wichtig ist
Entwickler von Robotiksystemen können leistungsstarke Richtlinien für Manipulationsaufgaben auf günstigerer Hardware ausführen, ohne dass die Erfolgsquote stark sinkt.