研究团队推出了LEGO‑Bench测试集,其中包含208张由模拟3D场景渲染而成的照片,用于衡量编程智能体根据单张图片编写Blender脚本的能力。研究人员测试了6种GPT配置;表现最好的GPT‑6 Astra在室内场景中有53.4%的重建结果正确,在室外场景中则为39.6%。智能体通常能生成可用的场景文件,但判断几何准确性的能力接近随机水平。加入一个能将场景锚定到参考图像的插件后,较弱模型的表现最高提升了62.7%。
为什么重要
对于3D工具开发者来说,结果表明AI能够自动完成初步场景创建,但要确保几何准确性,仍需要可靠的检查手段。