Une équipe a présenté LEGO‑Bench, un jeu de test composé de 208 photos générées à partir de scènes 3D simulées. Il mesure la capacité d’agents de programmation à écrire des scripts Blender à partir d’une seule image. Six configurations GPT ont été évaluées. Le meilleur modèle, GPT‑6 Astra, a correctement reconstruit des scènes d’intérieur dans 53.4 % des cas et des scènes d’extérieur dans 39.6 % des cas. Les agents parvenaient généralement à produire un fichier de scène exploitable, mais leur capacité à évaluer la précision géométrique était proche du hasard. L’ajout d’un plug-in qui ancre la scène sur l’image de référence a amélioré les résultats des modèles les moins performants jusqu’à 62.7 %.
Pourquoi c'est important
Pour les développeurs d’outils 3D, ces résultats montrent que l’IA peut automatiser la création initiale de scènes, mais qu’il reste nécessaire de disposer de méthodes fiables pour vérifier la géométrie.