
1. 多模态研究的版图为什么需要重新梳理过去两年多模态大模型MLLM的论文数量几乎是以季度为单位翻倍。2024年初大家还在讨论“视觉指令微调怎么做”到了2024年中LLaVA、Qwen-VL、InternVL 这类工作已经把图文对齐做成了标配2025年开始单纯的图文问答已经不够看了视频理解、音频-视觉联合推理、GUI Agent、具身智能里的世界模型World Model开始成为顶会的主力方向。到了2026年如果你还在用“多模态图文对齐”这个等式去理解这个领域基本等于用功能机的思路去理解智能手机。我自己从2023年底开始系统跟踪这个方向前后精读了大概两百多篇相关论文踩过不少坑有些工作看起来是“新架构”拆开一看只是换了投影层的初始化方式有些号称“统一多模态”实际上只是把多个模态的编码器拼在一起做了个拼接。所以这篇梳理不是简单的论文列表而是按照技术演进的逻辑把2024到2026年多模态研究的几条主线拆开来讲——从最基础的 Fusion 机制到 Reasoning Agent 的构建再到 World Model 这个更大的框架。每一块我都会说清楚它解决什么问题、核心方法是什么、实际复现时要注意什么、以及我踩过的坑。适合谁看如果你是多模态方向的研究生正在找选题或者需要快速补齐某个子方向的认知这篇可以直接当路线图用。如果你是工程师想把多模态能力落地到产品里里面关于 Fusion 选型、Agent 架构、评测陷阱的部分会帮你省掉大量试错时间。如果你只是对这个领域好奇我也会尽量用生活化的类比把核心概念讲清楚不堆公式。2. Fusion 机制从“拼接”到“深度融合”的三年演进2.1 早期 Fusion 的本质问题模态之间的“语言不通”多模态 Fusion 要解决的核心问题说白了就是图像、文本、音频这些不同模态的信息怎么让模型“同时理解”。早期最直接的做法是早期融合Early Fusion——把图像特征和文本特征在输入层就拼在一起送进同一个 Transformer。听起来很合理但实际效果往往很差原因在于不同模态的特征分布差异太大。图像经过 ViT 编码后每个 token 的数值范围、语义密度和文本 token 完全不在一个尺度上。直接拼接相当于让一个只会中文的人和一个只会阿拉伯语的人强行对话中间没有翻译。晚期融合Late Fusion则是另一个极端每个模态各自过自己的模型最后在输出层做加权或投票。这种做法在分类任务上还能用但一旦涉及跨模态推理——比如“图中这个人在做什么他手里的工具是用来干什么的”——就完全无能为力因为模态之间的交互只发生在最后一步中间没有任何信息交换。2024年之前大多数工作其实是在这两个极端之间找平衡点。BLIP-2 的 Q-Former 是一个标志性的中间路线用一组可学习的 query token 去“抽取”视觉特征再把这些 query 送进语言模型。这个设计的巧妙之处在于它把视觉信息压缩成了一个固定长度的序列语言模型不需要直接处理原始视觉 token降低了模态对齐的难度。但 Q-Former 的问题也很明显query 的数量是固定的对于信息量大的图像比如密集文本的文档截图压缩会丢失细节。2.2 2024年的关键转折投影层设计的“军备竞赛”2024年多模态 Fusion 最大的变化是大家开始意识到投影层Projection Layer的设计远比想象中重要。LLaVA 用的是最简单的两层 MLP把 ViT 的输出直接映射到语言模型的 embedding 空间。这个方案简单到令人发指但效果出奇地好原因在于它配合了高质量的视觉指令微调数据。这给整个领域上了一课Fusion 的效果不只取决于架构数据质量和训练策略同样关键。随后出现了一批改进投影层的工作。有把 MLP 换成 Transformer 的有引入可变形注意力Deformable Attention让投影层能自适应地关注图像的不同区域还有在投影层里加入门控机制的。我复现过其中几个实测下来投影层的复杂度提升带来的收益在大多数基准上其实很有限——除非你的任务对细粒度视觉信息特别敏感比如 OCR 密集的文档理解否则两层 MLP 加上足够好的数据性价比是最高的。这里有一个容易被忽略的细节投影层的初始化方式。很多论文不写这一点但实际训练时如果投影层初始化不当训练初期会出现严重的梯度爆炸或梯度消失。我自己的经验是用较小的方差初始化投影层权重同时在训练前几百步冻结语言模型只训练投影层等 loss 稳定后再解冻。这个技巧在多个复现中都帮我省掉了大量调参时间。2.3 2025年的深度融合Cross-Attention 的回归与改进到了2025年Cross-Attention 重新成为 Fusion 的主流方案但和早期的 Cross-Attention 有本质区别。早期的 Cross-Attention 是单向的——语言模型去 attend 视觉特征视觉特征本身不更新。2025年的工作开始做双向交互视觉 token 和文本 token 在每一层都互相 attend形成真正的“联合表示”。这个方向上有两个代表性思路。一个是 Flamingo 系列的延续在语言模型的每一层插入 gated cross-attention 层视觉信息通过门控机制逐步注入。另一个是更激进的方案直接把视觉 token 和文本 token 拼成一个长序列送进同一个 Transformer不做任何模态区分。后者在 2025 年下半年开始流行因为随着上下文窗口的扩大从 4K 到 128K 甚至更长拼接带来的计算开销变得可以接受而效果提升是实打实的。但这里有一个坑拼接方案对位置编码非常敏感。视觉 token 和文本 token 的位置编码如果处理不当模型会混淆“图像中左上角的物体”和“文本中第一个词”的位置关系。我试过几种方案比较稳的做法是给视觉 token 和文本 token 分别使用不同的位置编码区间同时在 attention mask 里显式标注模态边界。2.4 Fusion 选型的实操建议如果你现在要做一个多模态项目Fusion 方案怎么选我的建议是按任务复杂度分三档任务类型推荐 Fusion 方案理由简单图文分类/检索晚期融合 对比学习训练成本低模态间交互需求弱图文问答/描述生成投影层 语言模型成熟方案生态完善复现成本低视频理解/多轮推理双向 Cross-Attention 或拼接需要细粒度跨模态交互计算换效果还有一个容易被忽略的点Fusion 方案的选择要和预训练数据匹配。如果你用的是 LLaVA 系列的预训练权重强行换成拼接方案效果可能反而不如原版投影层因为权重里学到的模态对齐模式和新的 Fusion 方式不兼容。这种情况下要么从头预训练要么至少做一轮大规模的指令微调来重新对齐。3. Reasoning Agent多模态模型从“看懂”到“做事”的关键一跃3.1 为什么 Reasoning Agent 是多模态的下一站2024年的多模态模型核心能力是“看懂”——给一张图能描述、能问答、能定位。但“看懂”和“做事”之间有一条巨大的鸿沟。举个例子你给模型一张厨房的照片问“怎么做番茄炒蛋”模型可以告诉你步骤。但如果你说“帮我把番茄炒蛋做出来”模型需要做的就远不止理解图片——它需要规划步骤、操作工具、根据实时反馈调整动作。这就是 Reasoning Agent 要解决的问题。Reasoning Agent 的核心思路是把多模态模型从“感知器”升级为“决策器”。它不仅要理解视觉输入还要基于理解进行推理、规划、调用工具、执行动作并根据执行结果进行反思和调整。2025年开始这个方向上的论文数量激增但质量参差不齐。很多工作只是把 LLM 的 Agent 框架套了一个视觉编码器并没有真正解决多模态场景下的特殊挑战。3.2 多模态 Agent 的架构拆解一个完整的多模态 Reasoning Agent通常包含四个核心模块感知模块负责把原始的多模态输入图像、视频、音频、传感器数据转换成结构化的表示。这个模块的关键挑战是实时性——如果 Agent 需要在动态环境中做决策感知延迟必须控制在毫秒级。我见过一些工作用 ViT 做感知单帧推理就要几十毫秒在需要高频决策的场景比如机器人控制里根本不可用。实际落地时通常会用轻量级的检测模型如 YOLO 系列做第一层过滤只把关键区域送给大模型做精细理解。推理模块是 Agent 的“大脑”负责基于感知结果进行逻辑推理和任务规划。这里的一个核心问题是推理过程要不要显式输出早期工作倾向于让模型直接输出动作但 2025 年的趋势是让模型先输出推理链Chain-of-Thought再输出动作。这个改变带来的效果提升非常明显因为显式的推理链让模型的决策过程可解释、可调试也方便人类在关键步骤进行干预。工具调用模块让 Agent 能够使用外部工具——计算器、搜索引擎、代码执行器、API 接口等。多模态场景下的工具调用有一个特殊挑战工具的输出往往是文本或结构化数据Agent 需要把这些输出重新“翻译”回多模态空间。比如 Agent 调用了一个物体检测 API返回的是边界框坐标Agent 需要把这些坐标和原始图像对应起来才能继续推理。记忆模块负责存储和检索历史信息。多模态 Agent 的记忆比纯文本 Agent 复杂得多因为需要同时存储视觉特征、文本描述、动作历史等多种信息。我试过几种方案比较实用的是用向量数据库存储视觉特征的 embedding同时用结构化数据库存储动作和状态信息检索时做混合查询。3.3 训练多模态 Agent 的数据难题多模态 Agent 的训练数据是最大的瓶颈。纯文本 Agent 可以用互联网上的海量文本做预训练但多模态 Agent 需要的是“多模态输入 动作序列 结果反馈”的三元组数据这种数据在互联网上几乎不存在。目前主流的解决方案有三种。第一种是用模拟环境生成数据比如在虚拟厨房、虚拟办公室等场景里让 Agent 执行任务自动记录轨迹。这种方案的数据量大、成本低但模拟环境和真实世界的差距sim-to-real gap是绕不开的问题。第二种是用人类演示数据让真人操作并记录多模态输入和动作序列。这种数据质量高但采集成本极高而且规模有限。第三种是用模型自己生成数据——让一个较强的模型在环境中探索把成功的轨迹保存下来作为训练数据。这种方案在 2025 年下半年开始流行但需要解决“冷启动”问题模型一开始什么都不会怎么探索出成功的轨迹我自己的经验是三种方案结合使用效果最好先用模拟环境做大规模预训练再用人类演示数据做精调最后用模型自生成数据做迭代优化。这个流程听起来简单但每一步都有大量细节需要调。3.4 实操中的常见陷阱做多模态 Agent 最容易踩的坑是低估了“模态对齐”在动态环境中的难度。在静态图文任务里模态对齐是一次性的——图像编码一次文本编码一次然后做交互。但在 Agent 场景里环境是动态变化的每一帧的视觉输入都在变Agent 需要持续地重新对齐视觉和文本表示。如果对齐模块的更新频率跟不上环境变化的速度Agent 的决策就会基于过时的信息。另一个坑是动作空间的設計。多模态 Agent 的动作空间可以是离散的从预定义的动作列表里选一个也可以是连续的输出具体的控制信号。离散动作空间容易训练但灵活性差连续动作空间灵活但训练难度大。我的建议是如果任务的动作类型有限比如 GUI 操作只有点击、输入、滚动几种用离散空间如果是机器人控制这类需要精细连续控制的任务再考虑连续空间。4. World Model多模态研究的终极框架还是过度包装4.1 World Model 到底在说什么World Model 这个概念在 2024 年之前主要出现在强化学习和机器人领域指的是一个能够模拟环境动态的模型——给定当前状态和动作预测下一个状态。2025 年开始多模态社区开始把 World Model 和 MLLM 结合起来思路是如果多模态模型能够理解世界的视觉和文本信息那它是不是也能预测世界的未来状态这个思路的吸引力在于它把多模态模型从“被动理解”推向了“主动预测”。一个真正的 World Model 不仅能描述当前图像里有什么还能预测“如果执行某个动作下一帧图像会变成什么样”。这种能力对于规划、决策、仿真都有巨大价值。但这里有一个需要警惕的问题很多号称“World Model”的多模态工作实际上只是做了视频预测——给定前几帧预测下一帧。视频预测和 World Model 有本质区别视频预测只关心像素级的未来帧而 World Model 需要理解动作和状态之间的因果关系。一个只会做视频预测的模型你给它一个“拿起杯子”的动作它可能会生成一个杯子移动的画面但如果你问它“杯子会不会掉”它可能完全无法回答。4.2 多模态 World Model 的核心组件一个完整的多模态 World Model通常包含三个核心组件状态编码器负责把多模态观测图像、文本、传感器数据压缩成一个紧凑的状态表示。这个状态表示需要包含足够的信息来支持未来预测同时又要足够紧凑以便高效计算。这里的一个关键设计选择是状态表示是显式的还是隐式的显式状态比如物体列表、位置坐标可解释性强但需要人工设计隐式状态比如神经网络 embedding表达能力强但难以调试。动态模型负责根据当前状态和动作预测下一个状态。这是 World Model 最核心的部分也是训练难度最大的部分。动态模型需要学习环境的物理规律、因果关系、以及动作的影响。在视觉丰富的环境中动态模型还需要处理遮挡、光照变化、物体形变等复杂因素。解码器负责把预测的状态表示还原成可观测的多模态输出图像、文本描述等。解码器的质量直接影响 World Model 的可用性——如果预测的状态很准但解码出来的图像模糊不清那这个 World Model 在实际应用中价值有限。4.3 训练 World Model 的实操挑战训练多模态 World Model 最大的挑战是数据。你需要的是“多模态观测 动作 下一时刻观测”的三元组数据而且这些数据需要覆盖足够多的场景和动作类型。在机器人领域这类数据可以通过遥操作采集在自动驾驶领域可以通过实车路测采集但在通用场景下数据获取极其困难。我试过用视频数据来训练 World Model思路是把视频的相邻帧当作“当前观测”和“下一时刻观测”把帧间的变化当作“动作”。这个方案的问题在于视频里的变化往往不是由单一动作引起的——光照变化、物体自身运动、相机移动都会导致帧间差异。模型很难从这些混杂因素中分离出“动作”的影响。另一个挑战是长期预测的误差累积。World Model 做单步预测时可能很准但做多步预测时每一步的小误差会累积几步之后预测结果就完全偏离了。解决这个问题的方法通常有两种一种是在训练时加入多步预测的损失让模型学会纠正自己的误差另一种是在推理时用滚动时域控制Receding Horizon Control只信预测的前几步然后重新观测、重新预测。4.4 World Model 的实际价值判断World Model 目前还处于早期阶段实际落地的案例很少。我的判断是短期内 World Model 最有价值的应用场景是仿真和规划——用 World Model 生成大量虚拟场景来训练下游 Agent或者用 World Model 做模型预测控制MPC。在这些场景里World Model 不需要完美只需要比随机猜测好就行。长期来看World Model 如果真能做到“理解世界的因果结构”那它的价值是巨大的。但目前的 MLLM 离这个目标还有相当距离。我见过一些工作声称自己的模型“理解了物理规律”但仔细看实验往往只是在特定数据集上过拟合了。真正的物理理解需要模型能够泛化到未见过的场景和动作组合这需要全新的架构和训练范式。5. 多模态研究的工程化落地从论文到产品的距离5.1 评测基准的陷阱多模态论文里最常见的评测方式是刷 MMBench、MME、SEED 这些基准。但如果你真的要把模型落地到产品里这些基准的参考价值有限。原因很简单这些基准的题目大多是“这张图里有什么”“这个物体是什么颜色”这类感知层面的问题而产品里用户真正关心的是“这张图里的商品能不能退货”“这个文档里的关键信息是什么”这类任务层面的问题。我自己的做法是在选型阶段用公开基准做初筛但最终决策一定要用自己业务场景的数据做评测。而且评测指标不能只看准确率还要看延迟、吞吐、显存占用这些工程指标。我见过一个模型在 MMBench 上比另一个模型高 5 个点但推理延迟是后者的 3 倍在实际产品里根本不可用。5.2 数据管线的搭建多模态产品的数据管线比纯文本产品复杂得多。文本数据可以简单地做分词、去重、过滤但多模态数据需要处理图像分辨率、格式转换、模态对齐、标注质量等一系列问题。我踩过的一个坑是训练时用的图像是 224x224 的但产品里用户上传的图像是 4000x3000 的直接 resize 会导致细节丢失模型效果大幅下降。后来改成先做目标检测把关键区域裁剪出来再送进模型效果才恢复。另一个坑是模态缺失的处理。产品里经常出现用户只上传了图像没写文字或者只写了文字没上传图像的情况。如果模型训练时只见过“图像文本”的配对数据遇到模态缺失就会崩溃。解决方案是在训练时随机丢弃某个模态让模型学会在模态不完整的情况下也能工作。5.3 推理优化多模态模型的推理成本远高于纯文本模型因为视觉编码器的计算量很大。优化推理的常见手段包括用更小的视觉编码器比如用 ViT-S 代替 ViT-L、降低图像分辨率、用量化技术压缩模型、用缓存机制避免重复编码。我实测下来把视觉编码器从 ViT-L 换成 ViT-B精度损失通常在 1-2 个点以内但推理速度能提升 2-3 倍性价比很高。还有一个容易被忽略的优化点批处理。多模态模型的输入长度差异很大有的图像编码后只有几十个 token有的有上千个如果直接做批处理padding 会浪费大量计算。更好的做法是按输入长度分桶把长度相近的样本放在同一个 batch 里。6. 几个实操中总结的避坑经验6.1 不要迷信“统一多模态”2025 年很多论文在推“统一多模态”——用一个模型处理所有模态。听起来很美好但实际落地时统一模型往往在每个单独模态上的表现都不如专用模型。原因很简单不同模态的数据分布和任务特性差异太大强行用一个模型处理会导致模型容量被分散。我的建议是除非你的产品确实需要跨模态的深度交互否则用“专用模型 融合层”的方案更务实。6.2 训练数据的质量比数量重要多模态领域有一个常见的误区以为数据越多越好。但实际上低质量的图文对比如图像和文本不相关、文本描述过于简单对模型的伤害很大。我做过一个对比实验用 100 万条高质量图文对训练效果明显好于用 500 万条混杂数据训练。筛选高质量数据的方法包括用 CLIP 分数过滤、用 LLM 评估文本描述的质量、人工抽检等。6.3 注意模态偏差多模态模型很容易学到模态偏差——比如在训练数据里如果“狗”这个物体总是出现在室外场景模型可能会把“室外”和“狗”关联起来导致在室内场景里识别不出狗。这种偏差在基准测试里往往看不出来但在实际应用中会导致严重的错误。检测模态偏差的方法是做反事实测试把同一个物体放在不同背景下看模型的预测是否一致。6.4 小模型也有大用处不是所有场景都需要 70B 参数的多模态大模型。在很多垂直场景里比如工业质检、医疗影像初筛一个经过精调的小模型比如 7B 甚至更小就能达到很好的效果而且推理成本低、部署方便。我见过一个团队用 3B 的模型做商品图像分类效果和 70B 模型差不多但推理速度快了 20 倍。7. 这个方向后续可以怎么跟如果你正在找多模态方向的研究选题我的建议是关注三个交叉点。第一个是 Agent 和 World Model 的结合——让 Agent 在 World Model 生成的虚拟环境里训练再把学到的策略迁移到真实环境。这个方向的数据效率潜力很大但 sim-to-real 的问题需要认真解决。第二个是多模态推理的效率优化——现在的多模态模型推理成本还是太高如何在保持效果的前提下大幅降低计算量是一个有实际价值的问题。第三个是多模态评测的革新——现有的基准已经跟不上模型的发展需要更贴近真实任务、更能反映模型实际能力的评测方案。如果你是从工程落地的角度跟这个方向我的建议是不要追最新的论文而是把注意力放在数据管线和推理优化上。多模态产品的核心竞争力往往不在模型架构而在数据质量和工程效率。我见过太多团队在模型选型上反复折腾却忽略了数据清洗和推理优化最后产品效果上不去还找不到原因。最后分享一个我自己的习惯每读一篇多模态论文我都会问三个问题——它解决了什么之前解决不了的问题它的方法在什么条件下会失效如果我要复现最小的可行实验是什么这三个问题能帮我过滤掉大量“看起来很美但实际没用”的工作也能帮我把真正有价值的方法快速落地。