
文章主要内容和创新点主要内容本文提出了一种基于多模态大型语言模型(MLLMs)的自进化视觉-语言导航框架(SE-VLN),旨在解决现有视觉-语言导航(VLN)方法受限于大型语言模型(LLMs)固定知识库和推理能力、缺乏高效进化能力的问题。SE-VLN借鉴自然智能体的进化机制,使导航智能体能够在测试过程中持续进化。该框架包含三个核心模块:分层记忆模块:通过语言拓扑图记录智能体在每个节点的视觉观察和决策过程(短期记忆),并结合经验库存储长期积累的导航经验,为实时决策和经验提取提供支持。检索增强的基于思维的推理模块:利用检索增强生成(RAG)技术从经验库中检索与当前任务相关的历史经验,并结合思维链(CoT)提示将多源信息分解为可执行的多步推理链,动态更新语言拓扑图以优化决策。反思模块:基于任务评估结果对智能体的决策进行深度分析,通过结果评估器计算导航性能指标,再由经验校正器识别并修正不合理决策,将修正后的决策存入经验库,实现持续进化。实验表明,SE-VLN在R2R和REVERIE数据集的未知环境中分别达到57%和35.2%的导航成功率,相对现有最先进方法分别提升23.9%和15.0%,且随着经验库扩大,性能持续提升,验证了其自进化能力。创新点提出了首个基于多模态大型语言模型的无训练自进化VLN框架,模拟自然智能体的导航进化过程,无需大规模标注数据训练即可实现持续进