Xuanwang Zhang이 이끄는 연구진은 2026년 10월 6일 WebNavigator라는 논문을 공개했다. 이 시스템은 AI 에이전트가 웹사이트를 탐색하는 방식을 바꾼다. 시행착오를 거듭하며 돌아다니는 대신, 오프라인에서 가능한 동작을 미리 지도처럼 정리한 뒤 온라인에서 그 지도를 바탕으로 적절한 단계를 선택한다. WebArena 벤치마크 테스트에서 WebNavigator는 여러 사이트에 걸친 작업의 72.9%를 성공적으로 수행했다. 이는 앞서 보고된 상용 에이전트 가운데 가장 높은 성공률의 두 배가 넘는다.
작동 방식
WebNavigator는 사이트의 모든 클릭 가능한 요소와 양식을 기록하는 일종의 경로 안내도인 상호작용 그래프(Interaction Graph)를 만든다. 이 과정은 오프라인에서 실행돼 API 크레딧이 들지 않는 ‘토큰 비용 제로’ 탐색 방식으로 이뤄진다. 작업을 받으면 에이전트는 ‘검색-추론-순간이동(Retrieve-Reason-Teleport)’ 절차를 따른다. 관련 그래프 정보를 가져오고, 최적의 경로를 추론한 뒤, 필요한 페이지로 곧장 이동한다. 연구진은 기존에 전체 지도가 없었던 문제를 ‘위상적 맹목성(Topological Blindness)’이라고 부른다.
성능과 시사점
WebArena의 다중 사이트 과제 모음에서 새 접근법은 성공률 72.9%를 기록했다. 논문에 따르면 이는 ‘엔터프라이즈급 에이전트’의 성능을 두 배 이상 웃도는 수치다. OnlineMind2Web 벤치마크에서도 좋은 성과를 보였지만, 초록에는 정확한 수치가 나와 있지 않다. 이번 연구는 에이전트에 웹사이트 전체를 한눈에 파악할 수 있는 정보를 제공하는 것이 기반 언어 모델을 개선하는 것보다 더 중요할 수 있음을 시사한다.
왜 중요한가
양식을 작성하거나 데이터를 수집하는 봇을 만드는 개발자에게 성공률이 높아지면 실패하는 시도가 줄고, 수동으로 수정할 일도 적어진다. 이 방식은 비용이 많이 드는 시행착오를 줄여 자동화된 웹 서비스의 속도를 높이고 비용을 낮출 수 있다. 다만 레이아웃이 자주 바뀌는 사이트에서 이 방법이 어떻게 작동하는지는 아직 논문에서 다루지 않았다.