
Talk 3: Cosmos 3 Omnimodal World Models for Physical AI – Cosmos 3一款面向物理人工智能的全模态世界模型Max Zhaoshuo Li from Nvidia Cosmos Lab一、存在的问题物理 AI 领域存在数据核心瓶颈对比计算机使用的智能体、大语言模型获取物理交互数据受时空线性约束仅靠算力无法无限扩充。单纯依靠人工遥控采集数据、或是简易合成数据都不足以突破瓶颈我们需要全新范式 —— 世界基础模型为视觉 - 语言 - 动作VLA等各类物理智能应用提供底层通用基础能力。我们长期思考从智能体交互视角出发世界基础模型必须具备哪些核心能力才能成为通用底层底座。三大核心能力缺一不可现实场景理解能力正如劳拉刚才分享的微波炉取餐任务模型必须精准理解环境、物体的状态动作结果仿真预判能力和陈立提到的观点一致真实世界动作成本极高打碎物品无法复原但虚拟仿真可无成本反复试错推演能力、价值评估能力至关重要真实世界执行动作能力机器人领域研究者都十分熟悉模型需要能将抽象意图转化为真实物理动作。基于这三大需求我们研发了 Cosmos 3 全模态世界基础模型。劳拉提出的多模态融合思路我们高度认同Cosmos 3 将文本、图像、视频、音频、动作全部统一进单一模型同时支持全部模态的生成任务。二、核心功能第一现实时序场景理解。输入机器人操作视频观测画面Cosmos 3可作为视觉语言模型VLM完整推演全流程时序事件输出密集时序标注或画面状态预测。场景理解是所有物理智能模型的底层根基无法看懂环境就不可能输出有效动作。第二生成能力同样至关重要。现在音频恢复了只是存在一点延迟我先暂停视频这段交互的音效质感很不错。我们将音频视频与动作等一切模态联合建模这个演示案例里仅展示音视频生成效果。生成是检验模型是否真正理解 “给定控制信号或条件输入后未来会发生什么” 的核心手段。我们发现音频信息价值独特大量物理交互行为都能通过声音线索预判因此音频模态被纳入 Cosmos 3基础模型的建模。(foundation指代Cosmos 3) [ 这就是为什么它是我们建模Cosmos 3的基础之一。]第三世界仿真能力这个例子展示 Cosmos 3 模拟人类智能体与环境的复杂交互。画面左下角是第一视角相机轨迹右下角是手部姿态推演仿真完整复现人类拿起物体、放置在桌面上的全过程。我们极度看好第一视角自我中心数据这是让基础模型深度掌握物理交互逻辑最高效的数据类型。目前我们正和大量科研团队、开源社区合作把海量第一视角交互知识灌入模型。第四Cosmos 3 同时支持逆动力学推演模型不仅能输入动作预测未来画面还能输入多视角观测画面反向推演出产生该画面的底层动作序列。这项能力可作为无动作标注海量视频的数据挖掘工具尤其适配人类交互视频。演示中模型推演出的动作序列可以直接驱动 URDF 格式机器人模型完成移动。第五当Cosmos 3模型完整建模所有可能的物理状态与推演结果后比如动力学、视频生成、文本理解等可直接转化为能在真实世界执行动作的机器人策略。这个演示效果或许不算惊艳但核心逻辑是只要模型对足够多的环境状态建立完整表征这套状态理解或推演机制会自然转化为策略模型接收文本指令并落地执行。视觉推理、图文音视频生成、机器人策略、正 / 逆动力学模型 全部集成在同一模型中仅通过切换不同的输入输出模态空间全模态模型就能切换对应功能。三、IntroductionCosmos 初代发布时仅有 Nano、Super 两个系列超大尺寸模型算力门槛高很难用于机器人终端设备。为此我们专门研发 Cosmos Edge 轻量化版本可在英伟达 Jetson Thor 嵌入式终端实时推理无需云端集群 GPU 算力面向一线机器人开发者落地使用。基础 Cosmos 3 总参数量 4B推理塔、生成塔各 2BCosmos Nano 总 16B两大模块各 8B最大的Cosmos Super 64B双塔各 32B。不同尺寸适配不同场景策略推理需实时因此轻量化 Edge 版本单独优化。Cosmos 最新更新是和 Physical IntelligencePI联合完成策略评估能力验证。我们目前不宣称该方案可完全替代真实机器人评测真实世界评估依旧必不可少但 Cosmos 可以分担大部分虚拟评测工作相关研发进展顺利。机器人策略可与 Cosmos 3 联动借助Cosmos 3模型逆动力学能力完成一系列创新评测实验。上图是真实机器人策略执行过程在线虚拟评测时模型预判机器人不会把碗丢进垃圾桶判定任务失败这就是当前 Cosmos 3 可实现的评测效果。四、ArchitectureCosmos 整体分为两大模块一是推理塔负责环境理解等价于VLM视觉语言模型二是生成塔统一完成视频、音频、动作多模态生成。MOT架构: 在理解和双向生成时我们的注意力掩码基本上是因果关系的 [ 推理塔采用因果注意力掩码生成塔使用双向注意力掩码 ]。作为机器人专题研讨会我重点说明跨本体统一动作的方案模型当前支持自动驾驶车辆、相机运动、第一视角人体运动、单机械臂、双机械臂、人形机器人及各类夹爪。我们设计启发式算法拼接不同本体的动作向量实现最大化动作语义空间共享。五、处理不同的模态当我们处理不同的模态时一个棘手的问题是我们如何处理这些模态之间的潜在嵌入。所以这是我们提出的这样一切模态都可以统一起来。[ 多模态统一嵌入是一大难点 ]。我们基于旋转位置编码ROPE做适配语言是非常标准的ROPE我们在所有3个维度上增加索引 [ 文本采用标准多维递增 ROPE ]视频采用三维位置编码时间帧、画面宽、画面高音频、动作无空间宽高维度仅保留时间轴编码。所以全部模态编码逻辑兼容大语言模型的 ROPE 范式。这套设计最大限度复用大语言模型预训练语义先验但文本 token 本身无时间维度和音视频、动作时序天然冲突。我们统一基准帧率 24 帧 / 秒任意帧率的输入视频都会重新换算时序编码所有模态对齐真实物理时间而非无意义抽象索引。六、Training我前面演示的所有能力来自三种训练范式正动力学输入动作预测未来视频逆动力学输入观测视频反推产生画面的底层动作策略模式视频与动作联合去噪生成。七、Dataset推理塔预训练整理约 2200 万条多领域样本覆盖文字识别、目标定位等任务监督微调SFT筛选 220 万条物理 AI 专项子集。生成塔分三阶段训练预训练以文生图或图像生成视频生成和图生视频为主。预训练视频总时长约一百万小时实现场景覆盖这样大家能感觉到数据的数量。中期训练新增动作模态与仿真迁移数据 —— 机器人领域常用仿真迁移。我们生成Issac仿真它有很漂亮的SDG外观但你可以渲染它这样生成照片级真实画面且不篡改视频的物理规则所以这类样本纳入训练。论文首发时仅完成 Nano、Super 大模型训练然后后训练微调它们文生图和视频、图生视频以及适配 Droid 机器人的专属策略模型这样人们可以感受到Cosmos 3如何转成策略以及策略效果如何。八、QA1 你们这套大一统大模型是否真正缩小了动作对齐鸿沟尤其是轻量化 Edge 模型输出的动作只是视觉上看起来合理还是能真实适配物理环境完成任务论文里有详细说明Cosmos 基础预训练阶段完全不植入机器人专属控制参数仅作为通用状态转移机训练所有机器人控制信息都放在增量微调阶段后训练 Droid 机器人分支时才加入控制信号这套分层设计效果很好。底层设计思路是预训练追求极致通用、脱离特定硬件落地微调再针对性适配机器人本体。2 如何量化 Cosmos 生成画面的物理精准度怎么衡量推演物理规则和真实世界物理的误差我们配套了 PAI Bench 等专项物理评测基准专门为物理一致性评估等量身定制。[ 专门量化物理一致性 ]。动作被包括在为许多下游用户预训练——我猜我们称之为训练但可能是预训练——的一部分中的动机是我们认为将动作与视频相结合将提高许多物理推演的精度。不幸的是在这次迭代中我们没有看到一个强有力的指标或结果表明一旦你加入动作就会改善所有领域的物理效果因为现在所有视频都有动作。但我们确实看到了许多机器人领域的提升这种建模可以非常有用。3 您展示了不同系列的不同尺寸的Cosmos模型200万小时视频数据用来训练模型。您有使用不同数量的视频数据训练不同尺寸的模型吗他们是普遍一致的吗通常当你研究缩放定律你想确保数据词元匹配算力我们必须为端侧模型做一些取舍。例如我们完全剔除音频模态因为我们发现2B已经不足以处理另一个模态。一旦我们增加到8B和32B时就没有这个问题了。这是一个非常好的点一个开放问题当你做取舍时这取决于你的数据。因此由于数据不同我的经验永远不会转移到另一个团队的经验中。通常对于不同的尺寸都有一些取舍。我仍然相信更大的模型效果更好。希望将来某一天我们能有1T参数量的物理AI基础模型。