# WAM-Cache هزینه پردازش بینایی ربات را تا ۴۲٪ کم می‌کند

> این روشِ بی‌نیاز از آموزش مجدد، هزینه مدل ویدئویی را کاهش می‌دهد و دقت دست‌کاری اشیا را در فاصله‌ای اندک از خط پایه نگه می‌دارد.

Oossa · 2026-10-09 · https://oossa.com/fa/wam-cache-cuts-robot-vision-compute-by-up-to-42

پژوهشگرانی به سرپرستی کای دینگ، WAM-Cache را منتشر کردند؛ چارچوبی که نمایش‌های کلید-مقدارِ یک ترنسفورمر انتشار ویدئو را در بخش‌های کنترلی مختلف دوباره به کار می‌گیرد. این سامانه به‌جای محاسبه مجدد کل رمزگذار بصری در هر گام، فقط مجموعه‌ای پراکنده از توکن‌ها را تازه‌سازی می‌کند که بر پایه توجهِ متخصص کنش و معیاری برای سنجش تازگی بصری انتخاب شده‌اند؛ آن هم با محدودیت سخت‌گیرانه برای عمر توکن‌ها. در بنچمارک Fast-WAM، این روش تعداد عملیات ممیز شناور رمزگذار ویدئو را در RoboTwin 2.0، LIBERO و آزمایش‌های دنیای واقعی ۳۲ تا ۴۲٪ کاهش می‌دهد؛ در حالی که دقت آن در شبیه‌سازی فقط ۰٫۷ تا ۱٫۸ واحد درصد و روی یک ربات واقعی ۲٫۵ واحد درصد کمتر از خط پایه متراکم است.

## حقایق

- WAM-Cache در بنچمارک Fast-WAM، عملیات ممیز شناور پیش‌پردازشِ ویدئو در DiT را ۳۲ تا ۴۲٪ کاهش می‌دهد.
- افت دقت در شبیه‌سازی حداکثر ۱٫۸٪ و روی یک ربات واقعی ۲٫۵٪ است.

## چرا مهم است

توسعه‌دهندگان رباتیک می‌توانند سیاست‌های دست‌کاری اشیای پربازده را روی سخت‌افزار ارزان‌تری اجرا کنند، بی‌آنکه نرخ موفقیت به‌طور چشمگیری افت کند.

## منابع و ارجاع‌ها

1. [WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models](https://arxiv.org/abs/2610.11401) – arXiv cs.RO, 2026-10-09

آخرین به‌روزرسانی: 2026-10-09
