让机器人像人类一样 “边看边理解”,主动响应模糊需求(如 “我饿了”)而非仅执行明确指令(如 “拿香蕉”)—— 浙江大学与 vivo 人工智能实验室的联合团队,在 ACM MM 2025 上发表的新框架 CogDDN,首次将心理学 “双过程理论” 应用于移动机器人需求驱动导航(DDN),使导航成功率较现有 SOTA 方法提升 15%,为机器人适应复杂未知环境提供了全新思路。
一、研究动机:破解传统导航的 “刻板困境”
传统需求驱动导航依赖大量数据训练,仅能应对 “见过的场景”,面对模糊指令(如 “找个东西放花”)或陌生环境时易陷入僵局。团队受人类决策机制启发:
人类通过 “系统 1”(快速直觉判断)和 “系统 2”(深度理性推理)协同应对复杂情境,例如迷路时先凭直觉探索,再通过分析修正路线。
据此提出 CogDDN 框架,让机器人具备 “快速响应 + 深度反思” 的双过程能力,实现从 “被动执行” 到 “主动理解” 的跨越。
二、CogDDN 框架:模拟人类认知的 “双过程闭环”
该框架以视觉语言模型(VLM)为基础,包含 3 大核心模块,形成 “感知 - 匹配 - 决策” 的完整闭环:
3D 机器人感知模块
采用单目 3D 检测方法 UniMODE,仅通过单视角图像即可精准估算物体三维位置,摆脱对多视角或深度传感器的依赖,轻量化适配各类机器人硬件。
需求匹配模块
针对大型语言模型(LLM)易推荐 “次优解”(如用杯子养花)的问题,通过有监督微调(SFT)训练 LLM,强化 “需求 - 物体特性” 的精准匹配。例如,用户说 “放花” 时,优先推荐花盆而非杯子,提升目标选择准确性。
双过程决策模块(核心创新)
融合 “启发式过程”(系统 1)与 “分析过程”(系统 2),模拟人类 “直觉 - 理性” 协同决策:
启发式过程:
Explore 模块:目标未明确时,通过思维链(CoT)推理生成探索路径,扫描环境寻找潜在目标,避免重复探索;
Exploit 模块:发现目标后,利用知识库经验快速规划精准行动,如避开障碍物直达目标物。
分析过程:
当导航遇阻(如目标被遮挡),启动 “反思机制”—— 基于 VLM 的世界知识,分析失败原因(如路径规划错误),生成修正策略并存入知识库,通过微调反哺启发式过程,实现 “从错误中学习”。
三、实验验证:成功率提升 15%,适配复杂场景
在 AI2-THOR 模拟器及 ProcTHOR 数据集上的闭环测试(400 个场景)显示:
CogDDN 的导航成功率(NSR)较单视角 SOTA 方法 DDN 提升 15%,与依赖深度输入的 InstructNav 效果相当,证明其在无额外传感器时的高效性;
消融实验表明:移除 Exploit 模块或思维链(CoT)后,性能显著下降,验证了 “微调优化” 与 “推理逻辑” 的关键作用;
反思机制使加权路径长度成功率(SPL)随训练轮次持续提升,体现其持续学习与环境适应能力。
四、意义:为机器人装上 “会思考的大脑”
CogDDN 的突破不仅在于技术指标提升,更在于推动机器人导航从 “数据依赖” 转向 “认知驱动”:
无需海量场景数据,即可通过双过程决策应对未知环境与模糊指令;
闭环学习机制使其能持续优化策略,适配家庭、医院、仓库等多样化场景;
轻量化设计可无缝集成至现有机器人系统,加速实用化落地。
未来,随着多模态感知与大模型推理能力的深化,机器人有望真正实现 “类人理解”,成为更智能的生活助手。
免责声明:本文仅代表作者个人观点,与时尚科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

