Een team introduceerde LEGO‑Bench, een testset met 208 foto’s die zijn gerenderd vanuit gesimuleerde 3D-scènes. De benchmark meet hoe goed codeeragenten op basis van één afbeelding Blender-scripts kunnen schrijven. Er werden zes GPT-configuraties getest. Het beste model, GPT‑6 Astra, reconstrueerde binnenruimtes in 53,4% van de gevallen correct en buitenruimtes in 39,6%. De agenten konden doorgaans een bruikbaar scènebestand maken, maar hun vermogen om de geometrische nauwkeurigheid te beoordelen was bijna niet beter dan gokken. Een plug-in die de scène aan de referentieafbeelding verankert, verbeterde de zwakkere modellen met maximaal 62,7%.
Waarom het ertoe doet
Voor ontwikkelaars van 3D-tools laten de resultaten zien dat AI het maken van een eerste scène kan automatiseren, maar dat betrouwbare controles van de geometrie nog steeds nodig zijn.