Ein Forschungsteam unter der Leitung von Gengze Zhou hat NavGPT-3 vorgestellt, eine Laufzeitumgebung, die ein großes Sprachmodell mit einer reaktionsschnellen Aktionssteuerung für Roboter verbindet. Die Umgebung lässt Schlussfolgern, Handeln und Überwachen in getrennten Threads ablaufen. So kann der Roboter Aufgaben schnell unterbrechen und wechseln. Die Aktionssteuerung mit 8 Milliarden Parametern wurde anhand von 19,28 Millionen Beispielen trainiert und erreichte beim Benchmark R2R‑CE bereits eine Erfolgsquote von 74,5 %. Mit dem vollständigen System steigerte NavGPT-3 den Wert bei diesem Test auf 81,5 % und erreichte bei RxR‑CE menschliches Leistungsniveau. Pro Episode bewältigte das System die Routen in etwa 1 Minute und 22 Sekunden.
Warum es wichtig ist
Das zeigt, dass Roboter sprachliches Schlussfolgern auf hoher Ebene mit schneller Steuerung auf niedriger Ebene verbinden können. Damit rückt eine autonome Navigation näher, die ebenso schnell und zuverlässig ist wie die von Menschen.