# WAM-Cache, 로봇 비전 연산량 최대 42% 줄여

> 새로운 학습 없는 캐시 기법은 조작 정확도를 몇 퍼센트포인트 이내로 유지하면서 비디오 모델의 연산 비용을 낮춘다.

Oossa · 2026-10-09 · https://oossa.com/ko/wam-cache-cuts-robot-vision-compute-by-up-to-42

Kai Ding이 이끈 연구진은 비디오 확산 트랜스포머의 키·값 표현을 여러 제어 청크에 걸쳐 재사용하는 프레임워크 WAM-Cache를 공개했다. 매 단계마다 시각 인코더 전체를 다시 계산하는 대신, 행동 전문가의 어텐션과 시각적 변화량을 기준으로 선택한 일부 토큰만 갱신하되, 토큰의 사용 기간에는 엄격한 상한을 둔다. Fast-WAM 벤치마크에서 이 방식은 RoboTwin 2.0, LIBERO 및 실제 환경 테스트의 비디오 인코더 FLOPs를 32~42% 줄였으며, 시뮬레이션에서는 밀집 기준 모델보다 정확도가 0.7~1.8%포인트 낮은 수준을 유지했고 실제 로봇에서는 차이가 2.5%포인트였다.

## 팩트

- WAM-Cache는 Fast-WAM 벤치마크에서 비디오 DiT 프리필 FLOPs를 32~42% 줄인다.
- 정확도 하락 폭은 시뮬레이션에서 최대 1.8%, 실제 로봇에서 2.5%포인트다.

## 왜 중요한가

로봇 개발자는 성공률을 크게 낮추지 않고도 더 저렴한 하드웨어에서 고성능 조작 정책을 실행할 수 있다.

## 출처 및 참고 자료

1. [WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models](https://arxiv.org/abs/2610.11401) – arXiv cs.RO, 2026-10-09

최종 업데이트: 2026-10-09
