Des chercheurs dirigés par Gengze Zhou ont présenté NavGPT-3, un système d’exécution qui associe un grand modèle de langage à une politique d’action à faible latence pour les robots. Il exécute le raisonnement, l’action et la supervision dans des fils distincts, ce qui permet au robot d’interrompre rapidement une tâche et d’en changer. La politique d’action, qui compte 8 milliards de paramètres et a été entraînée sur 19.28 millions d’exemples, a déjà atteint un taux de réussite de 74.5% sur le benchmark R2R‑CE. Avec le système complet, NavGPT-3 a porté ce résultat à 81.5% sur ce test et égalé les performances humaines sur RxR‑CE, en parcourant les itinéraires en environ 1 minute 22 secondes par épisode.
Pourquoi c'est important
Ce résultat montre que les robots peuvent associer le raisonnement linguistique de haut niveau à un contrôle rapide de bas niveau, rapprochant la navigation autonome de la vitesse et de la fiabilité humaines.