Pesquisadores apresentaram um novo método chamado ACG-WAM para ensinar robôs a agir com base em informações visuais. Em um conjunto de 50 tarefas simuladas do RoboTwin 2.0, o sistema teve sucesso em 93.46% das tentativas em ambientes controlados e em 92.68% quando as cenas foram aleatorizadas. Em três tarefas no mundo real, alcançou 85.00% de sucesso total e 91.67% de conclusão parcial, superando o melhor sistema anterior, o Motus, em 10 e 9.17 pontos percentuais, respectivamente.
Como funciona o ACG-WAM
O método acrescenta um preditor auxiliar que aprende a antecipar características geométricas — como posições e formatos de objetos — vários passos à frente, usando a imagem atual da câmera do robô e as ações que ele executará. O preditor é treinado com referências geradas por um codificador visual congelado, que processa pares de imagens atuais e futuras. Depois do treinamento, o preditor adicional e os módulos usados como professores são removidos, deixando um modelo enxuto, capaz de funcionar no robô.
O que isso significa para quem usa robôs
As taxas de sucesso mais altas tanto em simulações quanto em equipamentos reais sugerem que robôs com o ACG-WAM poderiam aprender tarefas com mais confiabilidade e menos tentativas e erros. Para empresas que usam robôs em fábricas ou armazéns, o método poderia reduzir o tempo de inatividade causado por tentativas malsucedidas e encurtar o período necessário para ensinar novos comportamentos.
Por que importa
Para quem gerencia uma fábrica, os índices mais altos de sucesso significam que os robôs podem aprender novas tarefas mais rápido e com menos erros, o que pode reduzir os custos de treinamento. No entanto, o artigo não informa a confiabilidade no longo prazo nem como o método se adapta a tarefas mais complexas; portanto, esses benefícios ainda precisam ser confirmados em implantações maiores.