Kai Ding이 이끈 연구진은 비디오 확산 트랜스포머의 키·값 표현을 여러 제어 청크에 걸쳐 재사용하는 프레임워크 WAM-Cache를 공개했다. 매 단계마다 시각 인코더 전체를 다시 계산하는 대신, 행동 전문가의 어텐션과 시각적 변화량을 기준으로 선택한 일부 토큰만 갱신하되, 토큰의 사용 기간에는 엄격한 상한을 둔다. Fast-WAM 벤치마크에서 이 방식은 RoboTwin 2.0, LIBERO 및 실제 환경 테스트의 비디오 인코더 FLOPs를 32~42% 줄였으며, 시뮬레이션에서는 밀집 기준 모델보다 정확도가 0.7~1.8%포인트 낮은 수준을 유지했고 실제 로봇에서는 차이가 2.5%포인트였다.
왜 중요한가
로봇 개발자는 성공률을 크게 낮추지 않고도 더 저렴한 하드웨어에서 고성능 조작 정책을 실행할 수 있다.