ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Assessing the Value of Visual Input: A Benchmark of Multimodal Large Language Models for Robotic ...

Assessing the Value of Visual Input: A Benchmark of Multimodal Large Language Models for Robotic ... 文章主要内容和创新点主要内容本文旨在评估视觉输入对多模态大型语言模型(MLLMs)在机器人路径规划任务中的作用,通过构建全面的基准测试展开研究。研究团队在2D网格环境(模拟简化的机器人规划场景)中对15个多模态大型语言模型进行了评估,比较了仅文本输入与文本+视觉输入两种模式在不同模型规模(小型、中型、大型)和网格复杂度(8×8小网格、20×20大网格)下生成有效且最优路径的表现。结果显示:在简单的小网格任务中,模型成功率中等,视觉输入或少样本文本提示能带来一定增益;但在大网格任务中,性能显著下降,暴露出可扩展性难题。大型模型整体成功率更高,但视觉模态并非普遍优于结构良好的文本输入;且简单网格上的成功路径质量普遍较高。研究指出,当前多模态大型语言模型在鲁棒空间推理、约束遵守和可扩展多模态集成方面存在局限性,为未来在机器人路径规划领域的模型改进指明了方向。创新点系统性基准测试:首次针对多模态大型语言模型在机器人路径规划中视觉输入的价值进行系统评估,构建了2D网格环境作为受控测试平台,统一了评估指标(成功率、最优率、路径长度比等)。多维度对比:涵盖15个不同模型(覆盖不同规模、架构、访问方式),比较了仅文本(零样本、少样本提示)与文本+视觉输入的差异,以及不同网格复杂度下的表现,全面揭示了模型性能特征。关键发现:揭示了多模态模型在路径规划中的可扩展性挑战(大网格性能骤降),以及视觉模态并非普遍优于结构化文本的现象,为多模态模型在
返回列表