I ricercatori guidati da Gengze Zhou hanno presentato NavGPT-3, un ambiente di esecuzione che collega un modello linguistico di grandi dimensioni a una policy d’azione a bassa latenza per i robot. Il sistema esegue ragionamento, azione e monitoraggio in thread separati, consentendo al robot di interrompersi e cambiare attività rapidamente. La loro policy d’azione da 8‑miliardi di parametri, addestrata su 19.28 milioni di esempi, aveva già raggiunto il 74.5% di successo nel benchmark R2R‑CE. Con il sistema completo, NavGPT-3 è salito all’81.5% in quel test e ha eguagliato le prestazioni umane su RxR‑CE, completando i percorsi in circa 1 minuto 22 secondi per episodio.
Perché conta
Dimostra che i robot possono combinare il ragionamento linguistico di alto livello con un controllo rapido di basso livello, avvicinando la navigazione autonoma alla velocità e all’affidabilità umane.