Команда представила LEGO‑Bench — набор из 208 фотографий, созданных на основе смоделированных 3D-сцен. Он позволяет оценить, насколько хорошо ИИ-агенты могут писать скрипты для Blender по одному изображению. Исследователи протестировали шесть конфигураций GPT. Лучшая модель, GPT‑6 Astra, правильно воссоздавала интерьерные сцены в 53.4% случаев, а уличные — в 39.6%. Обычно агенты могли создать пригодный для работы файл сцены, но оценивали точность геометрии почти наугад. Плагин, который привязывает сцену к эталонному изображению, повысил результаты более слабых моделей на величину до 62.7%.
Почему это важно
Для разработчиков 3D-инструментов эти результаты показывают, что ИИ может автоматизировать создание начальной версии сцены, однако для надёжной проверки геометрии по-прежнему нужны дополнительные средства.