Oossa

WAM-Cache, 로봇 비전 연산량 최대 42% 줄여

새로운 학습 없는 캐시 기법은 조작 정확도를 몇 퍼센트포인트 이내로 유지하면서 비디오 모델의 연산 비용을 낮춘다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

Kai Ding이 이끈 연구진은 비디오 확산 트랜스포머의 키·값 표현을 여러 제어 청크에 걸쳐 재사용하는 프레임워크 WAM-Cache를 공개했다. 매 단계마다 시각 인코더 전체를 다시 계산하는 대신, 행동 전문가의 어텐션과 시각적 변화량을 기준으로 선택한 일부 토큰만 갱신하되, 토큰의 사용 기간에는 엄격한 상한을 둔다. Fast-WAM 벤치마크에서 이 방식은 RoboTwin 2.0, LIBERO 및 실제 환경 테스트의 비디오 인코더 FLOPs를 32~42% 줄였으며, 시뮬레이션에서는 밀집 기준 모델보다 정확도가 0.7~1.8%포인트 낮은 수준을 유지했고 실제 로봇에서는 차이가 2.5%포인트였다.

왜 중요한가

로봇 개발자는 성공률을 크게 낮추지 않고도 더 저렴한 하드웨어에서 고성능 조작 정책을 실행할 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.