Gengze Zhou领衔的研究团队推出了NavGPT-3。这套运行框架将大型语言模型与低延迟动作策略连接起来,让机器人能够导航。框架把推理、行动和监控分成独立线程运行,使机器人可以迅速中断当前任务并切换任务。研究团队的动作策略拥有80亿个参数,使用1928万条例子训练,在R2R‑CE基准测试中的成功率已达到74.5%。搭载完整系统后,NavGPT-3在该测试中的成功率提升至81.5%,在RxR‑CE上的表现则与人类持平,每个测试回合完成路线约需1分22秒。
为什么重要
这表明机器人能够将高层次的语言推理与快速的底层控制结合起来,让自主导航在速度和可靠性方面更接近人类。