研究チームは、コーディングエージェントが1枚の画像からBlenderスクリプトをどの程度作成できるかを測るテストセット「LEGO‑Bench」を発表した。シミュレーションした3Dシーンからレンダリングした写真208枚を使い、6種類のGPT構成を評価。最も高性能だったGPT‑6 Astraは、室内シーンを53.4%、屋外シーンを39.6%の正確さで再現した。エージェントはたいてい実用可能なシーンファイルを作成できたが、形状の正確さを判定する能力はほぼ運任せだった。参照画像にシーンを固定するプラグインを追加すると、性能の低いモデルでは正確さが最大62.7%向上した。
なぜ重要か
3Dツールの開発者にとって、この結果はAIがシーンの初期作成を自動化できる一方、形状を確実に検証する仕組みがなお必要であることを示している。