# WAM-Cache riduce fino al 42% il calcolo per la visione robotica

> La nuova cache, che non richiede addestramento, riduce i costi dei modelli video mantenendo l’accuratezza nella manipolazione entro pochi punti percentuali.

Oossa · 2026-10-09 · https://oossa.com/it/wam-cache-cuts-robot-vision-compute-by-up-to-42

Un gruppo di ricercatori guidato da Kai Ding ha presentato WAM-Cache, un framework che riutilizza le rappresentazioni key-value di un trasformatore di diffusione video tra un blocco di controllo e l’altro. Invece di ricalcolare a ogni passaggio l’intero encoder visivo, il sistema aggiorna solo un insieme sparso di token, selezionati in base all’attenzione dell’esperto di azioni e a una misura di sorpresa visiva, imponendo un limite massimo alla loro età. Nel benchmark Fast-WAM riduce del 32‑42% le operazioni FLOPs dell’encoder video su RoboTwin 2.0, LIBERO e nei test nel mondo reale, con risultati inferiori di 0,7‑1,8 punti percentuali rispetto al modello di riferimento completo nelle simulazioni e di 2,5 punti su un robot reale.

## I fatti

- WAM-Cache riduce del 32‑42% i FLOPs di prefill del DiT video (benchmark Fast-WAM).
- La perdita di accuratezza è al massimo dell’1.8 % nelle simulazioni e del 2.5 % su un robot reale.

## Perché conta

Gli sviluppatori di robotica possono eseguire policy di manipolazione ad alte prestazioni su hardware meno costoso, senza una forte riduzione dei tassi di successo.

## Fonti e riferimenti

1. [WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models](https://arxiv.org/abs/2610.11401) – arXiv cs.RO, 2026-10-09

Ultimo aggiornamento: 2026-10-09
