Un gruppo di ricercatori ha presentato LEGO‑Bench, un test composto da 208 foto generate da scene 3D simulate, per misurare quanto bene gli agenti di programmazione riescano a scrivere script per Blender partendo da una sola immagine. Sono state testate sei configurazioni GPT. Il modello migliore, GPT‑6 Astra, ha ricostruito correttamente le scene d’interni nel 53.4% dei casi e quelle esterne nel 39.6%. Gli agenti riuscivano in genere a produrre un file di scena utilizzabile, ma la loro capacità di valutare l’accuratezza geometrica era vicina a quella casuale. L’aggiunta di un plug-in che ancora la scena all’immagine di riferimento ha migliorato i modelli meno efficaci fino al 62.7%.
Perché conta
Per chi sviluppa strumenti 3D, i risultati mostrano che l’AI può automatizzare la creazione iniziale delle scene, ma servono ancora controlli affidabili della geometria.