Ein Team stellte LEGO‑Bench vor: einen Testsatz mit 208 Fotos, die aus simulierten 3D-Szenen gerendert wurden. Damit soll gemessen werden, wie gut Coding-Agenten anhand eines einzelnen Bildes Blender-Skripte schreiben. Getestet wurden sechs GPT-Konfigurationen. Das beste Modell, GPT‑6 Astra, rekonstruierte Innenräume in 53,4 Prozent und Außenbereiche in 39,6 Prozent der Fälle korrekt. Meist konnten die Agenten eine brauchbare Szenendatei erstellen, doch bei der Beurteilung der geometrischen Genauigkeit lagen sie kaum über Zufallsniveau. Ein Plug-in, das die Szene am Referenzbild ausrichtet, steigerte die Leistung schwächerer Modelle um bis zu 62,7 Prozent.
Warum es wichtig ist
Für Entwickler von 3D-Tools zeigen die Ergebnisse: KI kann die Erstellung erster Szenen automatisieren, doch für zuverlässige Geometrieprüfungen braucht es weiterhin geeignete Verfahren.