
如果你把感知、记忆、推理三个词放进一份世界模型评测表里会看到相当不错的成绩图像重建误差在下降视频预测做得有模有样多步推理也能给出完整链条。但把“动机”和“元认知”放进同一张表情况就急转直下——大多数模型在这两个维度上要么没有对应能力要么评测时根本找不到可操作的指标。我见过不少团队把世界模型 demo 跑得很漂亮可一旦追问“模型为什么主动去探索这个方向”“模型知不知道自己没见过这种场景”场面往往会冷下来。这不是某个模型的个案而是整个评测方法学的问题。下面要拆的验货思路不是权威标准而是一次完整的评测实践记录该用哪些维度、哪些任务、哪些指标以及为什么前三维容易及格、后两维几乎全军覆没。如果你正在做世界模型评测、大模型 Agent 能力分析或者只是想搞清楚“世界模型到底靠不靠谱”这篇内容会给你一条可复用的检查路径。1. 先弄清楚要给什么样的“世界模型”验货1.1 世界模型在四个场景里长相完全不同“世界模型”这个词在不同圈子里指的根本不是同一个东西甚至评测方式也完全对不上。在自动驾驶里世界模型通常指感知周围环境、预测下一时刻交通状态、再输出驾驶决策的联合模型。在具身智能里它指机器人通过视觉和触觉信息建立物理空间的内部表征用来规划抓取和移动。在视频生成里世界模型被理解成“能生成符合物理规律的新视频”的模型。在强化学习和游戏 AI 里世界模型又往往是一个环境的隐式模拟器用来在想象中做规划。这几种场景有一个共同点都要求模型不只是识别输入而是对环境的演化做出预判。但它们的评测任务差别很大。验货之前必须先把对象定义清楚否则就会出现“这边感知分数很高那边却说世界模型全是炒作”的互相打脸。我一般会先把模型按输入和输出格式分成三类输入感知数据、输出预测或插帧的“感知预测型”。输入历史状态、输出动作决策的“决策规划型”。输入文字或图片描述、生成未来画面的“生成模拟型”。每一类能验的内容完全不同。所谓给世界模型验货第一步是确认你手里拿的到底是哪一类货而不是拿自动驾驶的标准去验视频生成模型。1.2 五维验货清单是怎么来的选定对象之后再谈能力维度。这里用五个维度感知、记忆、推理、动机、元认知。前三个维度是传统 AI 能力评估的常客有相对成熟的测试方法和公开基准所以容易做到“及格”。后两个维度涉及模型的内部驱动力和自我认知目前既缺少公认评测任务又缺少稳定可计算的指标所以大多数模型在这两项上可以被判定为“能力缺失或评测缺失”。这个五维清单并不是要包揽世界模型的全部能力。它更像一个诊断框架先看模型能不能获取信息感知能不能保存信息记忆能不能利用信息做推断推理再看它有没有主动选择目标的能力动机以及它能不能感知自身认知状态的边界元认知。前三维解决“模型能不能做事”后两维回答“模型为什么做这件事、做错时知不知道自己做错了”。把这个问题想清楚之后后面所有评测任务的选择才有依据。下面按这个框架逐一拆解。2. 感知能及格但别把分数当成理解2.1 感知评测有标准答案这是先天的优势感知是整个评测体系里最容易拿分的项目。原因并不复杂感知任务有相对明确的答案。图像分类有标签目标检测有边界框视频预测有下一帧作为标准答案多模态对齐可以用检索命中率来算。模型输出的结果可以和某个基准直接比对分数算出来之后至少在统计意义上是可复现的。评测者不需要太多猜测模型“有没有理解”只需要看预测误差和正确率。这也是为什么很多世界模型项目对外展示时第一个放出来的往往都是感知结果让人看到模型能重建出清晰画面、能识别障碍物、能把点云和相机图像对齐。这类 demo 最容易打动观众也确实能反映一部分基础能力。但这里有一个默认前提训练分布内的感知是及格线不等于开放世界里的感知都及格。我在评测时会专门加两类额外测试一类是往输入里加入对抗噪声或遮挡看模型的预测是否剧烈变化一类是故意输入训练分布之外的场景看模型有没有“硬猜”而不是如实报错。很多模型在标准评测集上能到 90% 以上一到分布外测试就明显退化。所以感知的“及格”要打引号准确率高不等于理解了物理世界。2.2 物理一致性和分布外输入才是真正的考题感知评测的第二个问题是容易出现“像素级正确、物理级错误”。一个视频预测模型可以把下一帧的画面重建得非常清晰但仔细看物体运动可能违反重力、碰撞可能没有阻挡关系、光影变化不符合光源方向。这些错误在逐帧像素误差上暴露不出来因为像素差异很小但物理一致性是彻底的失败。所以建议在感知评测里加入“物理一致性抽检”把预测出的连续几帧播放出来让人或规则检查三个维度——遮挡关系是否保持运动轨迹是否连续交互之后的状态是否合理。例如一个物体被推到桌边的过程中它是先悬空再下坠还是一直贴着桌面移动两个物体碰撞后是否发生了合理的方向变化。不要只看重建误差。如果目标是自动驾驶或机器人场景还建议加入恶劣天气和光照变化的测试输入经典的路测本身就是这种抽检的简化版。感知的验货结论应该是在受控条件下有用在开放世界里只能算候选能力不能直接当作“理解”来宣传。3. 记忆能及格但很多时候是“看起来记住了”3.1 三种记忆类型必须分开测记忆评测比感知更讲究任务设计。不同记忆类型对世界模型的意义完全不同。第一种是工作记忆对应模型在单次交互过程中维持当前状态的能力。比如视频里有一段长镜头模型要记住物体之间的相对位置预测后面几帧时才不会错乱。评测方式通常是状态追踪任务让模型读完一段序列回答一个需要跨帧整合的问题。第二种是长期记忆对应跨会话、跨任务的知识保存能力。Agent 记忆、双网络记忆模型、记忆引擎这类方向都在解决这个问题。评测方式是给模型一批历史经验间隔若干轮任务后看它能否调用之前的信息完成当前任务。第三种是场景一致性记忆也是世界模型最核心的记忆能力模型必须记住一个物理场景里的主体、遮挡、属性和变化历史并在之后的决策中持续保持一致。比如机器人先看到一个杯子在桌上然后机器人转动视角模型应该知道杯子还在原来的大致位置如果杯子被移动模型要能更新它的状态。3.2 记忆评测最常见的三个坑记忆评测很容易出现假象。第一个坑是“局部提示作弊”表面上模型在回答需要记忆的问题实际上问题里的语境词已经包含了足够线索模型不需要真正回忆起之前的完整历史。我见过不少长上下文评测集正确答案其实可以通过上下文共现猜出来。所以记忆任务必须设计成“只有保持完整状态才能答对”的形态。第二个坑是“记忆时间窗口太短”。有些记忆评测只在一个 episode 内做状态追迹时间跨度不到几十步这种任务只要模型有足够大的上下文窗口就能蒙混。真正能看出记忆能力的是跨 episode、跨会话、输入被截断或压缩之后仍然能保持关键状态。第三个坑是“记忆与推理混在一起评”。当任务要求模型记住一段规则再推出答案时我们很难区分得了分是因为记忆好还是推理能力强。评测时要分离变量要么给足提示只测记忆要么禁止利用上下文只测推理。混在一起跑出来的分数参考意义很低。所以“记忆及格”是个很粗糙的判断。按我的标准至少要做到跨 session 状态保持、被干扰后仍能恢复、并且能把记忆转化成动作输出才能真正算过关。当前的模型中很多只能满足其中一个条件谈不上完整的世界记忆能力。4. 推理能及格前提是题目已经给了完整约束4.1 从单步推理到多步因果推理推理评测是最热闹的赛道之一。思维链、QBF 推理、视觉推理、图形推理、大模型推理优化每一类都有人在做。之所以推理能及格是因为推理任务通常给出了足够明确的约束题目里告诉你有几个对象、对象的属性、它们之间的规则模型只需要按照规则一步步推导。这种“给定前提求结论”的推理模型是可以学会的。神经网络擅长模式匹配逻辑链条只要在训练分布里出现过足够多次模型就能复现。所以在标准推理基准上拿到高正确率并不意外。但世界模型真正需要的推理往往面临另一类问题前提不完整。在物理世界或开放任务里模型面对的是大量未知信息。一道题说“这里有一个箱子可能装了东西”模型不知道该往哪个方向推。一个机器人进入房间不知道哪个抽屉可以打开。这种“自主找前提”的推理难度远高于“按给定条件推导”。评测推理能力时要特别注意这两者的区分。我的做法是加一组“前提缺失题”给模型一个场景隐去其中一个关键条件看模型是会提出疑问、做出合理假设还是直接凭空补一个条件继续推。绝大多数模型会选择后者这就是推理分数虚高的重要原因。4.2 评测推理要看错误结构而不是只看准确率只看正确率会掩盖很多问题。两个模型可能都答对了 80% 的题目但一个的错误集中在“假设前提错误”另一个的错误是“计算过程中某一步错”它们的可用性完全不同。我在评测里会记录错误分布答错时是第一步就错还是最后一步错是错误的因果归因还是算术失误是不知道规则还是不会把规则应用到新场景。这个错误结构比总正确率更有诊断价值。另外要关注一步到位的推理与多次修正的推理。模型能否在发现中间结果不合理时回溯并调整方向。目前很多推理模型是“一条路走到黑”错了就继续错到底缺乏回溯搜索能力。这种情况在多步因果推理里尤其明显。推理维度的结论是受控任务里能及格开放场景下还非常不成熟评测时一定要拆开看错误类型。5. 动机几乎全军覆没因为没有任何模型有真正的内在动机5.1 目标函数、奖励信号和动机不是一回事动机评测的难点首先在于概念本身。一个强化学习智能体有奖励函数一个对话模型有用户意图优化目标一个探索机器人的环境中设置了好奇心系数但这些都不是“动机”。动机指的是模型在没有外部指令的情况下仍然会主动选择某个方向行动的内部驱动力。在人类身上它表现为好奇心、成就欲、规避危险等内在倾向。对世界模型来说动机意味着在模型主动与环境交互时它选择探索哪个区域、尝试哪个动作、维持哪个目标的依据必须来自模型自身状态而不是直接来自训练标签或每一步的外部奖励。目前绝大多数模型是“被动的任务执行器”你给它一张图它预测下一帧你给它一个任务目标它尽力完成。如果没人给它任务它不会主动产生“我要去看看那个角落发生了什么”的行为。从严格意义上讲这就是动机能力全失。5.2 可观察的代理指标探索权重的选择自动化评测动机很难但可以通过观察行为序列来判断。我建议采用三个代理指标探索行为面对多个可选动作时模型是否倾向于尝试信息增益更高的动作而不是只选择即时回报最高的动作。目标保持在长任务中遇到干扰事件时模型能否回到原有目标而不是被无关信号带走。选项偏好一致性模型在没有明确奖励差异的情况下会不会形成稳定的偏好顺序且这个偏好是否有助于任务完成。三个代理指标只能说明“看起来有动机”不能证明内部状态真的存在动机。评测时要在固定环境里跑多条轨迹统计探索频率和决策切换情况不能只给一次交互就打分。一个只有奖励函数、没有内在状态的模型在这些指标上通常表现为“只选最快得分路径、遇到失败就原地打转、不会主动尝试变体”。这基本是全军覆没的状态。5.3 动机评测为什么很难自动化动机评测难自动化还有一个现实原因评估者预设太多。给模型一段开放环境视频人类会觉得“模型应该主动观察未知物体”。但机器并没有这种预设。要让评测可量化就必须先定义“主动”的粒度多久没动作算被动选择哪个动作算主动探索频率多高算动机强。这些阈值一旦定死就越过“模型是否有动机”这个本质变成“模型的参数是否适合某个阈值设定”。这也是为什么大多数世界模型评测根本不列动机这一栏。6. 元认知几乎全军覆没模型不知道“自己不知道”6.1 信心校准是第一个能算出来的指标元认知评测里相对可计算的是信心校准模型对自己输出的置信度和它实际答对的概率是不是一致。如果模型说“我有 90% 把握”的时候真实正确率只有 60%说明它严重高估自己元认知能力不足。具体评测方式不算复杂让模型针对一系列任务给出答案同时输出置信度分数再把置信度分桶统计看每个桶内的实际正确率。一个理想模型应该满足置信度 80% 的答案约等于 80% 正确。当前大模型和世界模型普遍存在的问题是答案越像训练数据中的常见模式模型越自信一旦输入是长尾场景、低频率事件模型甚至意识不到自己进入了陌生的分布仍然给出很高的置信度。实际测试中信心校准曲线会呈现明显的倒挂越难的样本置信度可能越高。这种情况比低准确率更危险因为下游系统在采用模型输出时无法区分哪些结果是可靠的。6.2 错误觉察与策略切换信心校准只能说明“模型是否知道答案可靠”还不足以覆盖元认知的全部。真正的元认知还包含错误觉察和策略切换。错误觉察的任务可以这样设计让模型完成一个推理任务后故意追问“你确定吗请重新检查你的步骤”观察它能否发现之前的错误并修正。这里特别要注意如果模型因为被追问就盲目换答案即使最后改对也不是元认知只是服从指令。只有模型能定位到具体错误步骤、解释为什么错、并选择新策略才算有元认知能力。策略切换更难测。模型面对一道不擅长的任务时能否主动改变方法而不是继续沿用旧方法。例如视觉推理题能通过画辅助线解决文字模型不具备画图能力它是否知道自己需要转换成更结构化的表示。目前大多数模型做不到这一点原因是它们没有“自己的认知状态”这样一个可操作对象。它们的自我反思能力来自训练过程中被指令对齐出来的外部行为并不是对自身推理过程的真实监控。6.3 给元认知设计压力测试任务我给元认知验货时会用三组压力测试分布外问题故意问一个与训练主题完全不同的问题看模型是否会立刻给出模糊回答还是会坦然承认不熟悉。无解问题设计一个问题内容里包含矛盾条件看模型能否察觉这题无解而不是硬凑一个答案。输出来源测试让模型判断某个答案是基于推理还是基于记忆看它能不能区分自己是从知识库检索而来还是现场推导而来。这三组任务目前没有统一评分标准但跑完之后很容易形成结论模型大多数情况会把“不知道”伪装成“知道”把“记忆输出”说成“推理结论”。这说明它们的元认知能力不是差一点而是整体上还没长出这个功能。7. 一份可以直接用的“验货”流程7.1 五维度任务与指标速查表如果你要动手验一个世界模型我建议不要从头设计所有评测任务先按下面这张表做减法。表格给的是任务、核心指标、及格判断和常见坑实际跑的时候可以按模型类型删减。能力维度建议评测任务核心指标及格判断常见坑感知图像重建、视频预测、多模态对齐、物理一致性抽检重建误差、预测准确率、遮挡关系保持标准集上结果稳定且分布外输入不会剧烈退化只看像素误差忽略物理一致性记忆状态追踪、跨会话调用、压缩后恢复跨步正确率、干扰后恢复率跨会话仍能维持关键状态小样本演示能复现局部提示作弊时间窗口太短推理单步逻辑题、多步因果推理、前提缺失题正确率、错误结构、回溯修正能力不仅正确率高且错误不是集中在前提假设错误上尝试重试或测试集刷题导致虚高动机开放探索轨迹、目标保持、选项偏好一致性探索频率、目标恢复率、偏好一致性无外部指令时仍出现稳定的探索行为把奖励函数或好奇心系数当作动机元认知信心校准、错误觉察、分布外自报置信度-实际正确率校准曲线、错误定位率置信度与正确率达到可接受一致性能主动承认未知把“被追问后改答案”当成元认知这张表的价值不在于给出绝对标准而在于让评测者知道每一种能力应该观察什么、不应该被什么误导。7.2 验货顺序和三条硬经验实际操作时顺序比指标更重要。我的推荐顺序是用最小样本跑一遍全部维度先确认输入输出能跑通日志和结果目录正常。在单一维度上把任务数量加满跑出该维度的分数分布不要直接用平均值。前三维跑完后再做交叉测试把记忆和推理混在一起把感知和推理混在一起看是否存在能力互相依赖。动机和元认知放到最后因为这两项任务通常没有公开基准需要人工标注或规则判断不适合一上来就全自动跑。三条硬经验第一不要一上来就开最大并发或多卡并行。世界模型评测任务往往要吃大量显存先估算一下模型需要的显存和内存再决定 batch size。很多视频预测任务在单机跑不动不代表模型不行可能是资源不够。第二一定要保存失败案例。只报平均分没有任何诊断价值。评测报告里至少要留 10 个典型失败样本包括输入、预期输出、实际输出和失败切片。第三区分“能力缺失”和“评测缺失”。如果模型没有动机维度可能是模型本身没有这个能力如果评测者设计不出合适的任务也会显得模型全败。这两个原因要分开说否则会冤枉模型。8. 别急着用榜单下结论能力分数和真实理解之间还有很大距离8.1 前三维“及格”为什么只是阶段性的感知、记忆、推理能及格本质原因是这三类能力都可以被外部任务量化并且任务约束越强模型越容易表现为合格。这不代表模型已经真正理解世界。一个视频预测模型能生成物理上合理的下一帧不代表它知道重力、惯性、遮挡这些概念是为什么成立的。正确率可以高但模型内部可能仍然停在表征层面的匹配。我在评测中更愿意给前三维打“阶段性及格”在受控任务里这些能力确实可用但在开放环境里稳定性和泛化性仍然是巨大问题。如果把世界模型用在自动驾驶或机器人上前三维只是基础素质离真正落地还有大量边界要处理。8.2 后两维“全败”反而给评测者留出了真正有价值的机会动机和元认知几乎全军覆没这不是坏消息。它意味着当前评测方法学存在巨大空白也意味着真正能做出可计算、可复现的动机和元认知评测任务的人会给这个领域带来非常大的价值。我很期待看到两个方向一是用行为序列和动态建模方式把动机变成可观测变量而不是停留在哲学讨论二是把信心校准做成标准评测组件让每个世界模型公开发布时都附上校准曲线而不是只放几个高光 demo。这比争论“世界模型是不是炒作”更有建设性。8.3 如果你也要评测世界模型最后留给你一份自查清单如果你接下来要自己动手不用急着造新指标先过一次这份清单你定义的“世界模型”是哪一类输入输出形态是什么你评测的是模型能力还是评测任务本身的可完成度分数是平均值还是有分布、有失败案例你有没有加入分布外输入和物理一致性检查你把工作记忆、长期记忆、场景一致性分开测了吗推理任务给的前提是完整还是缺失你试图证明的“动机”是代理指标还是模型内部真实动机模型说“我有把握”时它真的有把握吗把这份清单完整过一遍之后再对外说“世界模型行或不行”会稳很多。评测本身也是一项值得被评测的工作它比单点刷分更能反映一个模型的真实边界。