
前言过去一年具身智能领域在模型架构上展开激烈范式之争一派坚守 VLA视觉-语言-动作模型认为端到端直接从图像映射到机械臂动作结构精炼、推理极快是高频实时闭环控制的唯一可行方案另一派力推 WAM世界动作模型主张机器人不能只会模仿历史轨迹“盲目反应”而应像人类一样在动作前先推演物理世界的画面与空间变化不过我个人认为啊单纯的VLA或WAM目前在落地方面目前都还不太行但VLA结合上RL(即RL微调VLA)相比“单纯的VLA和单纯的WAM”而言在目前工业场景中的应用落地相对更成熟点至于一年没去过几十个工厂的 就不要不懂装懂、或人云亦云了毕竟更进一步算法也只是个基础真正决定落地成败的更关键还是数据本身的质量 一系列工程优化言归正传虽然在理论上单纯的世界模型比单纯的VLA更具泛化潜力但 WAM 一旦落地真实硬件便撞上工程高墙推理延迟与计算开销比如真实抓取与装配任务需要 10Hz–50Hz 以上的控制频率而传统 WAM 每预测一帧高分辨率画面需数十步扩散去噪端侧耗时动辄数百毫秒乃至数秒——机械臂等待“幻想未来”时的卡顿反而扼杀了实时闭环行业由此陷入两难选 VLA要忍受其在复杂接触任务中的泛化瓶颈选 WAM则要为庞大算力买单甚至被迫训练部署两套模型权重华盛顿大学与英伟达团队最新推出的 Flex-π 正是为打破这一对立而来。它不争论“谁淘汰谁”而是务实兼容让 WAM 兼容 VLA将范式之争转化为同一模型权重内部的快慢路径选择顺带说一句今天是26年十一假期的第一天解读该篇paper其实不论全球具身技术 如何变化快永远追踪全球最前沿并花大精力落地到实际生产应用中是我司「视频号上搜七月具身July」自24年起十年不变的宗旨第一部分 Flex-π: A Multi-Stream World-Action Model with Compute Flexibility1.1 引言与相关工作1.1.1 引言通用型机器人策略中一类能够联合预测未来观测和动作的模型——世界-动作模型World-Action ModelsWAMs——近期已被证明是视觉-语言-动作模型VLAs的有力替代方案WAMs 的示教效率和泛化能力主要得益于两个因素第一它们在训练过程中通过联合预测动作和未来观测来学习鲁棒的表示Zhu et al., 2025; Ye et al., 2026b第二它们从在大规模视频数据上预训练的视频生成骨干网络中继承了强有力的时空先验Kim et al., 2026b; Yuan etal., 2026b; NVIDIA et al., 2026作者在这两个方面的基础上进一步提升训练得到的 WAM策略在示教效率和泛化能力上都有显著提高同时依然保持足够的推理速度以满足部署需求尽管对未来视觉观测的预测是 WAM 训练的核心但当前通用型 WAM 几乎一律是基于视频生成模型编码器来预测未来的 RGB 图像潜变量Ye 等2026a;bYuan 等2026b虽然这种方式行之有效但这些通过像素重建训练得到的潜变量主要捕捉的是外观细节并没有与机器人操作所需的三维结构或物体语义对齐若能直接监督几何与物体语义就能同时获取这两类信息为 WAM 提供更强的联合预测训练信号但代价高昂需要额外的传感器模态、训练新的先验或牺牲推理速度本文要探讨的是如何在不付出这些代价的前提下放大 WAM 的优势——即联合预测能力和强视觉先验为了解决这些问题来自1 University of Washington、2 Allen Institute for AI的研究者提出了FLEX-π这是一种拥有 60 亿参数的 WAM通过训练来预测不仅是未来的 RGB 观测还包括未来的三维点图3D pointmaps和物体级语义因此在示例效率和泛化能力方面都非常出色其paper地址为Flex-π: A Multi-Stream World-Action Model with Compute Flexibility其项目地址为flex-pi.github.io其github地址为github.com/geyan21/flex-pi具体而言FLEX-π 不会产生前述三种成本中的任何一种。点图和物体语义都从同一张RGB图像中提取——分别通过Depth Anything 3和DINOv3因此不需要 RGB 之外的任何传感器模态两种编码器都是即取即用的预训练模型因此不需要再训练新的视觉先验————关于DINO v3参见本博客中的解读《Meta发布的自监督ViT DINO的发展史从DINO、DINOv2到通用视觉特征提取器DINOv3》而且由于在部署时可以丢弃任意视觉模态同时模型仍能从额外的训练监督中受益因此不会增加推理延迟更进一步而言FLEX-π 使用来自一个预训练视频生成模型Wan 等, 2025的单一冻结 VAE将 RGB 图像和3D pointmap一并编码到同一潜在空间中——尽管该 VAE 只在 RGB 像素上进行过训练但它仍能直接重建 pointmap并结合DINOv3Siméoni 等, 2026来构建以目标为中心的 DINO 特征FLEX-π 将每一种视觉模态都嵌入到一个共享的 token stream潜在空间中每种模态对应一条 token 流随后它将每条流路由进入一个 Mixture-of-TransformersLiang 等, 2025主干网络。由于动作与每个未来视觉流是联合生成的该策略能够继承互联网规模预训练所带来的丰富先验并为动作生成学习到更强的内部表征最后FLEX-π 在训练过程中随机丢弃部分视觉输入流并施加跨模态 forcing——无论某个模态是否作为输入被观测到都要生成其未来流——从而使得单个训练好的 checkpoint 在推理时具备对任意可用视觉输入与输出子集进行操作的灵活性这使得实践者可以在部署阶段自行选择位于速度–性能折中曲线上的位置而不是在训练阶段就将其固定见图 1——即既可以选择VLA-style(action only)进行部署也可以选择WAM-style(RGB 3D DINO)进行部署即其同时接收RGB、3D和DINO视觉特征并联合生成潜在的未来视觉特征和动作。完成训练后它支持灵活的推理模式使终端用户能够在时延与性能之间进行权衡总体而言FLEX-π 证明了一个WAM 几乎可以“免费”获得语义和几何层面的落地——无需新传感器、无需新的预训练、无需更慢的推理速度——从而在保持足够快速以便部署的同时带来更优的策略性能1.1.2 相关工作首先对于通用操作策略一个重要的研究方向是在预训练视觉-语言模型之上构建通用操作策略表明基于网络规模数据学得的先验可以迁移到机器人控制中相比专用策略获得更强的泛化能力Brohan 等,2023RT-2Black 等, 2024π₀Niu 等, 2024LLARVAIntelligence 等, 2025π₀.₅NVIDIA 等, 2025GR00T N1Li 等, 2025aHAMSTERGoyal 等,2025VLA-0Team 等2025Gemini RoboticsChen 等2025bTraining Strategies for Efficient Embodied ReasoningLee 等2025MolmoActYan 等2025bManiFlowFang 等2026MolmoAct2Zha等2026LAPChen 等2026Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical ControlKim 等2026aRLDX-1 Technical ReportWu 等2026Barreiros 等2026Galaxea Team2026Galaxea G0.5在动作微调过程中它们在不建模未来观测的情况下预测动作说白了就是VLA第二类研究路线则侧重于预测视觉输入如何随时间变化具体做法要么是在图像空间中进行规划要么通过联合的世界–动作目标来对策略进行正则化早期方法将控制建模为文本条件的视频生成Du 等2023或者先在网页数据上预训练视频生成器再对其进行下游操作任务的微调Wu 等2024Cheang 等2024GR-2Zhou 等2024bRoboDreamer更新的工作则在这一范式上进行扩展和规模化Jang 等2025DreamGenHuang 等2025bDreamGenBi 等2025MotusGao 等2026DreamDojoYin等2026PlayWorldWang 等2026Guo 等2026Ctrl-WorldZhang 等2026具体而言诸如UWMZhu 等2025Unified World Models和 DreamZeroYe 等2026b这样的联合世界–动作模型会同时执行动作和视频生成相比仅进行动作生成这种方式可以学习到更优的表征出于计算效率的考虑大多数基于世界模型的策略都会在潜在表征空间中进行预测Zhou 等2024aDINO-WMMaes 等2026LeWorldModelHafner 等20202023Hansen 等2024TD-MPC22026Zhu 等2025与Flex-π的工作最为接近的是近期通用型的 WAM 策略通常从预训练的视频生成模型初始化并采用针对潜在RGB 的预测目标Ye 等2026baGigaWorld-PolicyLi 等2026Zhang 等2026Yuan 等2026bFast-WAM然而与只预测单一 RGB 潜变量序列不同FLEX-π 会共同去噪 RGB 的潜变量、表示物体语义的DINO 特征以及 3D 点云映射从而将 WAM 训练监督扩展到几何与语义两方面的关注其次对于多模态策略学习越来越多的研究通过引入额外输入来为操作任务提供语义支撑例如提供显式的3D 输入Shridhar et al., 2022Perceiver-Actor; Zhu et al., 2023; Shi et al., 2023RoboCook; Goyal et al., 2024RVT-2; Ze et al.,20243D Diffusion Policy; Yan et al., 2025aDNAct; Li et al., 2025b ; Zhen et al., 20243D-VLA; Singh et al., 2025OG-VLA; Qu et al., 2025SpatialVLA; Yanet al., 2025b或学习 3D 世界模型Peri et al., 2024; Huang et al., 2025aParticleFormer; 2026PointWorld; Duisterhof etal., 2026相比之下FLEX-π 直接将 3D 特征投影到与 DINO 和 RGB 特征共享的潜在空间中具体做法是使用一个预训练视频世界模型的 VAE 编码器对与对应 RGB 图像具有相同形状的 3D点云映射进行编码。此外即便在推理阶段没有 3D 输入FLEX-π 依然可以正常工作其他研究表明在训练过程中对额外的输入模态进行掩蔽例如通过扩散噪声处理可以使策略泛化得更好Block 等2023Hong 等2026TMRL或者在推理阶段灵活变换输入模态Skand 等2024Huang 等2025c而作者通过注意力掩蔽同时去掉视觉输入和输出并在此条件下训练 FLEX-π 仍然去预测输入中缺失的视觉模态跨模态强制见第 3.2 节且作者宣称他们发现这种做法通过迫使模型从其他模态中内化每一种视觉表征从而提升了策略性能(图 12)1.2 FLEX-π一种计算灵活的多流 WAM综上作者将 FLEX-π 具体实现为一种世界—动作模型world-action model在 RGB 之外还通过对未来三维几何和物体语义进行监督进行训练同时不会产生三类额外代价额外传感器输入、单独训练的视觉先验或额外的推理延迟且作者使用来自同一个预训练视频生成模型的单个冻结 VAE同时对 RGB 图像和 3D 点云图3D pointmaps进行编码并使用一个冻结的DINOv3 编码器提供物体级语义 token每种视觉输入模态各自形成一个 token 流再通过一个Mixture-of-Transformers 主干网络进行融合该主干由同一视频模型初始化即在时间步 tRGB 图像 ot和三维点云映射 pt由预训练的 Wan-2.2 VAE 编码为潜在标记序列,DINOv3 生成语义标记。A流存在掩码 maskₘᵢₙ用于选择在共享的视觉 Transformer 主干网络中被关注的视觉流一个较小的动作专家Action Expert对这些视觉流进行交叉注意以生成在时间步 tH 处的动作片段aₜ:ₜ₊ₕ。条件 (sₜ, lₜ) 在各个流之间共享而输出掩码 mₒᵤₜ则用于设定在与动作联合生成时哪些未来的视觉流彼此可见且作者在训练过程中对输入和输出同时进行掩蔽从而得到一个单一的 checkpoint可在推理时支持任意组合的输入和输出流1.2.0 问题表述与背景知识首先作者的目标是训练一种策略使其在给定图像观测、本体感知状态和语言指令的条件下预测动作此外作者假设可以访问来自 DINO-v3Siméoni 等2026编码器的 DINO 特征以及以点图pointmaps形式表示的 3D 信息由 Depth Anything 3Lin 等2026应用于获得然后训练一个灵活的世界动作模型World Action ModelWAM该模型也可以生成任意子集的未来视觉输入模态并且在最小情况下只需接收单一视觉输入例如注意对应于一个动作块输出观测同理但为提高可读性在本文的大部分内容中省略块的记号其次对于用于视频生成模型的流匹配Flow Matching作者考虑到当前最先进的视频生成模型HaCo-hen 等2024Kong 等2024Wan 等2025NVIDIA2025NVIDIA 等2026通常利用一个图像编码器 Enc 和解码器 Dec例如一组作为变分自编码器VAEKingma Welling, 2013的一部分训练的 U-NetRonneberger 等, 2015将图像编码到潜在空间预测未来的潜在图像然后将其解码回重建图像对真实下一时刻潜在表示的预测是通过一个基于 flow matchingLipman et al.,2023; Liu et al., 2023b 的扩散 TransformerPeebles Xie, 2022模型来完成的——ps关于扩散transformer可以参见本博客中的解读《Diffusion Transformer(DiT)——将扩散过程中的U-Net换成ViT近频繁用于视频生成与机器人动作预测(含清华Prediction with Action详解)》该模型基于线性路径进行训练 其中ϵ ∼ N(0, I)流动时间步对于的本质就是把真实未来 latent 和随机噪声按比例混合构造训练样本其中 τ 控制“离真实答案有多近”τ0 是纯噪声τ1 是真实 latent模型看到中间状态学习从噪声指向真实 latent 的方向「毕竟向量的方向终点向量干净画面-起点向量噪声」推理时就沿这个方向从噪声一步步生成未来————ps如果还不太理解则详见本博客中此文《π0——用于通用机器人控制的VLA模型一套框架控制7种机械臂(基于PaliGemma和流匹配的3B模型)》的“1.2.2 流匹配(含对流匹配及速度向量公式的详解)”一节故对流动路径的恒定速度进行回归(定义为公式1)在推理阶段是通过在到区间内对进行 K 次 Euler 积分生成的随后经由Dec 解码。关键在于(Enc, Dec) 为任意图像形状的张量定义了一个潜空间作者将其同时用于图像和点图。需要注意的是从 π 采样对应于沿着流体常微分方程flow ODE在激活的输出通道上对进行积分1.2.1 输入视觉流与模型骨干网络FLEX-π 在三种互为补充的视觉token流上运行每一种分别提供视觉、空间或物体级语义信息RGB 图像和 3D 点图分别增加外观上下文和显式空间几何信息两者都由同一个、来自预训练视频生成模型的冻结 VAE 编码因此这两路流都可直接继承大规模视频预训练得到的时空先验DINO 特征由冻结的DINOv3Siméoni 等人2026编码器计算用于以物体语义来辅助锚定其他特征第一对于视觉输入编码作者使用了Wan-2.2-5B视频生成模型中VAE的冻结编码器和解码器。出乎意料的是作者发现直接使用这个仅在图像上训练的、已冻结的 VAE 对点图进行编码再解码就能得到非常精确的重建结果使其潜在空间在编码三维信息的同时保持——场景结构图 3啥意思呢为方便大家更好的理解我再补充说明一下简单说作者把 3D pointmap 当成一张“特殊的图片”来处理Pointmap 每个像素存的不是 RGB 颜色而是三维坐标 (x,y,z) 。作者发现即使 Wan-2.2 的 VAE 原本是为图像训练的直接用它压缩和还原 pointmap效果也非常好所以好处是不用再训练一个专门的 3D 编码器RGB 和 3D pointmap 可以共用同一个 VAE latent 空间同时还能保留场景的三维结构。图中 Reconstruction 和 GT Pointmap 很接近就是在证明这一点对于 DINO作者保留所有 patch token并将每个 2×2 的 patch 邻域无损折叠成单个 token768→3072 维度可参见 PixelUnshuffleShi 等人2016在不丢弃空间细节的前提下将模型生成的 token 数量减少到原来的 1/4详见附录 A.3 节第二对于全局条件文本指令由来自Wan-2.2的冻结umT5编码器Chung等2023处理并与编码细节见A.1节结合作为潜在预测模型的全局条件向量如图2所示FLEX-π的输入为第三模型骨干给定上面公式 (2) 中的输入作者训练一个潜变量 DiT 模型该模型同时预测未来动作以及RGB、pointmap和DINO潜在 token联合预测未来图像已被证明可以提升动作预测性能Zhu et al., 2025; Ye et al.,2026b; Dyna Robotics, 2026在作者的实验中作者宣称他们同样证明这一结论同时适用于pointmap 和 DINO 特征且为在融合所有输入与输出模态的同时减少训练与推理时间作者采用 mixture-of-transformersMoTLiang et al., 2025模型用同一个Transformer 主干网络50 亿参数直接从预训练的 Wan-2.2-5B 初始化处理所有视觉模态 token、、并为每种模态配备独立的前馈投影网络同时为动作生成部分单独设置键、查询、值、前馈以及归一化参数约 10 亿参数作者减小了隐藏维度跨流注意力仅应用在 30 个 MoT 模块中的中间 16 层因此早期编码和后期解码保持流特定stream-specific而跨模态融合发生在中间主干部分所有输出、、、最终都通过流特定的前馈预测头进行解码并使用流匹配损失公式 (1)进行训练由于动作expert 比主干更窄作者按照重采样resampling而非直接拷贝的方式从 Wan-2.2 进行初始化Yuan et al., 2026b附录 A.3 详细介绍了这一过程以及将各模态映射入共享主干并从中映射出的每流 adapter第四对于因果联合生成所有输出、、和 都是联合生成的动作 token 会关注当前观测 token 、 、 并交叉关注所有处于激活状态的视觉输出 token因此动作生成可以利用模型中不断演化的未来表示。注意力是单向的——任何视觉 token 都不会关注动作流——完整注意力规则见附录 A.51.2.2 通过视觉流 Dropout 和跨模态 Forcing 的灵活训练单个 FLEX-π 检查点在推理阶段无需重新训练就能够支持任意可用输入与输出流的组合——从仅生成动作到进行完整的联合生成即使只有 1 路视觉输入也可以实现。作者通过视觉流 dropout 和跨模态forcing 来实现这一点具体细节如下所述首先对于视觉流 Dropout作者在三个潜在视觉流——RGB、DINO和Pointmap——上为每个样本构造两个相互独立的二值掩码输入存在掩码用于选择在时刻提供哪些视觉流作为条件输出注意力掩码见图 2用于控制未来 token 之间的联合生成注意力包括动作 token 交叉关注哪些视觉输出以及未来视觉 token 之间如何相互关注每个视觉输入都会以 0.5 的概率被独立丢弃但至少会保留一个视觉流作为观测见附录 A.5关键在于并不是损失掩码它只决定动作 token 读取哪些未来流而每个未来流始终都会被去噪并计入相应的 Flow Matching 损失式 3这些未来流既会相互关注也会关注时刻已观测到的流因此动作是基于一个联合生成的未来而不是三个彼此独立的未来进行条件化的其次对于跨模态强制Cross-Modality Forcing由于两个掩码是独立采样的从输入中被丢弃的某一条流在输出端仍然要被去噪模型必须仅根据其余流来合成该模态在未来时刻的内容作者将这一机制称为跨模态强制并将其应用于三个视觉流因此训练将涵盖在时刻观测到的的任意非空子集到在时刻生成的任意子集之间的所有映射例如在没有 3D 输入的情况下仅由 RGB 和 DINO 想象未来的点云图pointmaps由 RGB 和几何信息预测未来的 DINO 语义等等见图 4即如上图所示单一检查点兼容任意视觉输入与输出。每一行表示一种示例训练方案由采样得到的m_in决定在时间 t 观测哪些流、以及 m_out决定在联合预测时哪些视觉输出是可见的共同确定标示的是一个跨模态强制cross-modality forcing的示例其中 pointmap 输入不被关注不被注意到但其他输出的联合生成仍然以生成的 pointmap 未来为条件从而鼓励 FLEX-π 内化 3D表征这一约束让人联想到掩码语言模型Devlin 等2019Reimers Gurevych2019或掩码视觉自编码器He 等2022它迫使 FLEX-π 内化 3D、RGB 以及以物体为中心的表征从而有助于策略学习作者在原论文第 4.5 节中有展示移除这一机制会导致性能下降1.2.3 训练目标、数据与推理在架构第 3.1 节和 dropout 方案第 3.2 节确定之后训练和推理都可归结为在给定样本中处于激活状态的任意流上执行 flow matching首先对于损失由于每一个未来流都在不考虑输出掩码的情况下被去噪训练目标会对动作流和所有三个视觉流的、由公式 (1)给出的逐流(flow-matching)损失求和其中、是逐流的损失权重在作者报告的所有实验中都设为 1。输出掩码只是注意力掩码而不是损失掩码——每个流的 head 仍然按照公式 (3) 进行训练对于 DINO作者使用“x-prediction”Salimans Ho, 2022head 预测的是干净特征而不是速度因为第 3.1 节中的 DINO 折叠操作会将每个 token 的特征维度提升到 3072在该维度下进行速度预测性能会退化Li He, 2025附录 A.4 节其次对于预训练与微调作者在约 500 小时、来自 AG-IBOT World-BetaAgiBot-World-Contributors 等2025中 100 个任务的数据上对 FLEX-π 进行预训练该数据集是一个大规模双臂操作数据集以30Hz 采样率从一个头戴摄像头和两个手腕摄像头记录Pointmap 通过使用 Depth Anything3Lin 等2026对这三个视角全部进行标注获得更多预训练细节见附录 B。预训练完成后我们在每个实验域上进行特定领域的微调最后对于推理给定选定的输入/输出模式FLEX-π 在激活的输出流上对流匹配常微分方程flow-matchingODE运行 K 步 Euler 积分并输出长度为 H 的动作块见附录 A.2原论文第 4.5 节评估了这些不同选择各自的成本与收益附录 I 描述了用于测量报告延迟的、无需额外训练的部署栈而附录 A 提供了更多架构细节// 待更