연구진은 코딩 에이전트가 단일 이미지로부터 Blender 스크립트를 얼마나 잘 작성하는지 측정하기 위해, 시뮬레이션한 3D 장면을 렌더링한 사진 208장으로 구성된 테스트 세트 LEGO‑Bench를 선보였다. GPT 구성 6종을 시험한 결과, 최고 모델인 GPT‑6 Astra는 실내 장면을 53.4%, 실외 장면을 39.6%의 정확도로 재구성했다. 에이전트는 대체로 사용할 수 있는 장면 파일을 만들었지만, 기하 구조의 정확성을 판단하는 능력은 무작위 추측에 가까웠다. 기준 이미지에 장면을 맞추는 플러그인을 추가하자 성능이 낮은 모델의 정확도가 최대 62.7% 향상됐다.
왜 중요한가
3D 도구 개발자에게 이번 결과는 AI가 초기 장면 제작을 자동화할 수 있지만, 기하 구조를 신뢰성 있게 검증하려면 여전히 별도의 점검이 필요하다는 점을 보여준다.