# WAM-Cache senkt Rechenaufwand für Robotersicht um bis zu 42 %

> Der neue Cache kommt ohne zusätzliches Training aus und senkt die Kosten für Videomodelle. Die Genauigkeit bei Manipulationsaufgaben bleibt dabei nahezu erhalten.

Oossa · 2026-10-09 · https://oossa.com/de/wam-cache-cuts-robot-vision-compute-by-up-to-42

Ein Forschungsteam unter der Leitung von Kai Ding hat WAM-Cache vorgestellt. Das Framework verwendet Key-Value-Repräsentationen eines Video-Diffusion-Transformers über mehrere Steuerungsabschnitte hinweg erneut. Statt den gesamten visuellen Encoder bei jedem Schritt neu zu berechnen, aktualisiert das System nur eine kleine Auswahl an Tokens. Diese wird anhand der Aufmerksamkeit des Action-Experten und eines Maßes für visuelle Überraschungen bestimmt; außerdem gilt eine strenge Altersgrenze. Im Fast-WAM-Benchmark senkt das Verfahren die FLOPs des Video-Encoders auf RoboTwin 2.0, LIBERO und in Tests in der realen Welt um 32–42 %. In Simulationen liegt die Leistung dabei höchstens 0,7–1,8 Prozentpunkte unter der dichten Referenz; bei einem realen Roboter beträgt der Abstand 2,5 Prozentpunkte.

## Die Fakten

- WAM-Cache senkt die FLOPs beim Prefill des Video-DiT im Fast-WAM-Benchmark um 32–42 %.
- Der Genauigkeitsverlust beträgt höchstens 1,8 % in Simulationen und 2,5 % bei einem realen Roboter.

## Warum es wichtig ist

Entwickler von Robotiksystemen können leistungsstarke Richtlinien für Manipulationsaufgaben auf günstigerer Hardware ausführen, ohne dass die Erfolgsquote stark sinkt.

## Quellen und Referenzen

1. [WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models](https://arxiv.org/abs/2610.11401) – arXiv cs.RO, 2026-10-09

Zuletzt aktualisiert: 2026-10-09
