
摘要本文解读 IROS 2025 论文《Ag2x2: Robust Agent-Agnostic Visual Representations for Zero-Shot Bimanual Manipulation》。该论文提出Ag2x2 协调感知的智能体无关视觉表征通过融合人手 2D 坐标、时间对比学习与倾斜式奖励塑形让机器人在既没有专家示范、也没有人工奖励的条件下零样本学会双臂操作其特别之处在于把「智能体无关」从抹去人手重新表述为只保留手的坐标这一个可迁移接口。实验表明Ag2x2 在 13 个双臂任务上平均成功率达到 73.5%比同族 Ag2Manip 高 17.1 个百分点甚至超过人工设计奖励的 63.2%为人类视频驱动的机器人技能获取提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果任务与评测协议主结果逐任务成功率消融手部坐标到底值多少控制实验增益到底来自预训练还是本体感受轨迹质量定性结果与模仿学习结果对比总结关键发现局限性常见问题FAQAg2x2 和 Ag2Manip 的核心区别是什么为什么「只留手的位置」就能跨过人机形态差这个方法需要专家示范或者奖励函数吗训练一个技能要多少算力为什么不直接用 LLM 生成奖励这个方法目前学不会什么阅读原文时有哪些容易踩的坑参考链接论文基本信息项目内容标题英文Ag2x2: Robust Agent-Agnostic Visual Representations for Zero-Shot Bimanual Manipulation标题中文协调感知的智能体无关视觉表征零样本双臂操作作者Ziyin Xiong, Yinghan Chen, Puhao Li, Yixin Zhu, Tengyu Liu†, Siyuan Huang†* 共同一作† 通讯机构北京通用人工智能研究院BIGAI· 北京大学 · 剑桥大学会议IROS 2025IEEE/RSJ International Conference on Intelligent Robots and SystemsarXivhttps://arxiv.org/abs/2507.19817项目网站https://ziyin-xiong.github.io/ag2x2.github.io/背景与动机用两只手协同完成一件事对人类来说是再自然不过的日常能力但对机器人来说双臂操作至今仍是难题。论文开篇把这件事说得很直白机器人操作今天依然被一个人类习以为常的技能卡住——把两只手一起用起来。困难来自两个瓶颈。第一是对专家监督的依赖行为克隆类方法要采集大量双臂遥操作示范成本极高结构化表征方法如 Bi-KVIL 与 PerAct² 虽然提升了泛化但共享同一个示范瓶颈无法真正规模化。第二是双臂协调本身两只手必须在空间与时序上配合才谈得上开门、递物、整直绳索这类任务。现有的第三条路是强化学习。Bi-DexHands 展示了令人印象深刻的灵巧度但它依赖精心设计、任务专用的奖励函数这些奖励需要大量专家知识且很难跨任务泛化。用大语言模型自动生成奖励的Eureka缓解了人工设计成本但论文的实验显示它只在目标状态容易描述的任务上有效。在视觉表征这一侧任务专用的对比学习CURL、DeepMDP难以跨任务泛化通用预训练表征RRL、R3M与VIP在单臂场景表现不错但迁移到双臂就明显失效——它们要么只做单臂要么把两只手当成彼此独立的智能体要么根本不建模手与手之间的空间关系。最直接的对照是前作Ag2ManipIROS 2024。它首次提出「智能体无关」的思路把人类区域整块抹掉让表征只关注物体状态的变化从而跨过人机之间的形态差。但论文指出这个做法把具身信息整体删掉了——包括两只手的相对位置而这恰恰是双臂协调的承重信息。于是本文的问题被精确定位成一件事抹掉人之后到底该留下什么研究主线从问题到结论图 5研究主线Mermaid 流程图。从「双臂操作缺协调信号」出发经过「前作抹掉人手也删掉手间关系」「只保留双手 2D 坐标」「位置 token 时间对比学习」「倾斜式奖励塑造 PPO 策略」最终收敛到「13 任务 73.5%超过人工奖励」。基准/方法设计Ag2x2 的核心是一套协调感知coordination-aware的智能体无关视觉表征。它的做法是把 RGB 图像与双手的二维坐标拼在一起再编码让表征在保持智能体无关的同时显式具备双臂空间推理能力。具体的数据流向是原始输入是图像的三通道加上双手各自的两个坐标编码器把它映射成一个 K 维隐层表征。关键取舍只有一句——只保留手的位置仍然丢弃人类的外形与运动学细节。手在哪里可以跨过人机形态差手长什么样不行。支撑这个设计的数据管线完全是自动化的用换掉骨干网络的HaMeR检测手部把三维关键点投影到二维取每只手 21 个关键点的均值作为该手的位置同时用ODISE做分割、用E²FGVI做视频修复生成智能体无关的帧。由此得到的样本既保留了手的位置又抹去了人的外观。图 1Ag2x2 概览。左从人类操作视频中学习协调感知表征——抹去人体外形但保留高亮的双手位置右用该表征在仿真中自主获取多种双臂技能多台 Franka 机械臂依次完成开柜、开门与绳索操作。分类全景这篇论文要解决的问题可以放进一张「双臂技能获取方法」的全景图里看。四条既有路线各缺一角Ag2x2 是第五条。图 6双臂技能获取方法全景Mermaid 图。智能体感知表征R3M · VIP、智能体无关表征Ag2Manip、LLM 生成奖励Eureka、人工奖励工程expert reward四条路线各缺一角Ag2x2 是第五条。方法细节方法由两个组件构成一个协调感知的视觉编码器以及一套基于该表征的策略学习与奖励塑形机制。编码器的两阶段训练。第一阶段只微调ViT-Large它预训练于 ImageNet-21k这里只用修复后的图像作为输入并采用LoRA秩 $r4$作用于所有自注意力层的 query 与 value 矩阵来保住预训练知识、同时保持训练高效。第二阶段引入手部位置每只手的二维坐标经一个两层 MLP隐藏维 $[16, 32]$ReLU 激活编码成位置 token与图像 token 拼接对被遮挡或出画的手用一个手特有的可学习变量占位避免缺失值破坏表征。两个阶段都优化同一个时间对比目标。时间对比目标。正负样本的定义是核心同一段视频内时间上相近的两帧是正样本同一时刻来自不同视频的帧是负样本。损失写作 $\mathcal{L} \mathcal{L}{tcn} \mathcal{L}{reg}$其中 $\mathcal{L}{tcn} -\log \frac{e^{S(z_i,z_j)}}{e^{S(z_i,z_j)} e^{S(z_i,z_k)} e^{S(z_i,z_l)}}$正则项 $\mathcal{L}{reg} \lVert \mathcal{F}\phi(o) \rVert_1 \lVert \mathcal{F}\phi(o) \rVert_2$。这样学到的表征刻画的是任务进展而不是场景身份。策略学习与奖励塑形。两条手臂被表示为两个自由浮动的代理球球的碰撞半径是 2 cm交互半径是 5 cm先用GraspNet找出物体的可行抓取位姿当代理与该位姿的距离小于 5 cm 时判定抓取成功。动作被拆成两部分位置目标 $a_p^t \in \mathbb{R}^6$ 与意图力 $a_f^t \in \mathbb{R}^6$由 PD 控制器转成代理的实际运动最后用逆运动学映射回两条 Franka 机械臂的关节指令。奖励函数是这篇论文最值得琢磨的一处设计。它不是「比上一帧更好就给分」而是以初始状态与目标的相似度$\beta S(z_0,z_g)$ 为基准线要求当前状态超过初始条件$\mathcal{R} \exp((1\alpha \cdot \mathbf{1}_{S\beta}) \cdot (S(z_t,z_g)-\beta)/\beta) - 1$其中 $\alpha 0$ 控制奖励缩放消融实验给出的取值是 $\alpha 3.0$。这样做的收益是在训练早期策略行为还接近随机时只要状态比起点更接近目标就能获得正奖励探索信号不会断。训练成本。表征学习分两段视觉适配阶段在 4 张 NVIDIA A100 上跑 40 小时手部位置整合阶段在 8 张 A100 上跑 20 小时。策略侧用的是 PPO每个操作技能在单张 3090 工作站上约需 3 小时。图 2Ag2x2 框架。(a) 表征学习在保留手部位置信息的智能体无关人类示范上做时间对比学习(b) 技能学习用智能体无关的动作表示做强化学习机器人从失败尝试逐步学会把方块放进微波炉。实验设计与结果任务与评测协议实验覆盖13 个双臂操作任务全部是单阶段、机械夹爪可完成的任务。其中 6 个来自Bi-DexHands关门向外、关门向内、开笔帽、举锅、挥杯、合剪刀另外 7 个来自PerAct²推箱、方块入抽屉、方块入微波炉、举托盘、按按钮、扫灰尘、整直绳索。多阶段任务需要中间目标定义超出了当前框架被直接排除。评测协议上每个任务组合3 个随机种子 × 3 个相机视角中/上/下共 9 次评测训练时使用 68 个并行环境每个任务跑 200 个 episode。仿真平台是 NVIDIA IsaacGym机器人是两条 9 自由度 Franka Emika 机械臂。表征在 EpicKitchen 上自学习。对照方法包括智能体感知的R3M与VIP、智能体无关的Ag2Manip、关闭人类反馈的Eureka、以及人工设计的奖励函数消融版本是去掉手部特征的Ag2x2-H。主结果方法Bi-DexHandsPerAct²总体EurekaLLM 生成奖励14.8%15.9%15.4%VIP智能体感知25.9%27.0%26.5%Ag2Manip智能体无关66.7%47.6%56.4%人工奖励expert reward85.2%44.4%63.2%Ag2x2-H去手部坐标70.4%46.0%57.3%Ag2x2本文85.2%63.5%73.5%Ag2x2 在 Bi-DexHands 上达到 85.2%在 PerAct² 上达到 63.5%整体平均 73.5%。相比同族的 Ag2Manip 提升 17.1 个百分点相比需要人工设计奖励函数的专家方案高出 10.3 个百分点——而它既没有用到专家示范也没有任何奖励工程。逐任务成功率Bi-DexHands 六个任务每格满分 9共 54 次评测任务Ag2x2-HAg2x2人工奖励Ag2Manip关门向外7786关门向内4699开笔帽7967举锅7864挥杯4783合剪刀9997六个任务合计成功 46 次占 85.2%与人工奖励持平去掉手部坐标后掉到 38 次仅 70.4%。值得注意的是「关门向内」人工奖励与 Ag2Manip 都能拿满分 9Ag2x2 只有 6 分——这个任务更依赖奖励函数的精确设计而不是表征质量。PerAct² 七个任务每格满分 9共 63 次评测任务Ag2x2-HAg2x2人工奖励Ag2Manip推箱5652方块入抽屉4503方块入微波炉3263举托盘5733按按钮8959扫灰尘3636整直绳索3564七个任务合计成功 40 次占 63.5%。失败集中在两类模式上一类是客体干扰容器的运动在视觉上压过了物体放置与手部运动方块入抽屉与方块入微波炉就是典型另一类是协调不同步比如关门向内时一只手提前把门关上或者整直绳索时一只手已经到位、另一只还差一点点。消融手部坐标到底值多少论文的消融版本 Ag2x2-H 去掉了手部相关特征。结果相当干净Bi-DexHands 从 85.2% 掉到 70.4%PerAct² 从 63.5% 掉到 46.0%整体掉 16.2 个百分点。更关键的是Ag2x2-H 的总体表现57.3%与 Ag2Manip56.4%几乎相同——这说明增益来自手部信息本身而不是架构改动。控制实验增益到底来自预训练还是本体感受一个容易被忽略的疑问是Ag2x2 的优势究竟来自预训练阶段的视觉表征还是来自策略学习阶段拿到的本体感受信号论文做了一个控制实验在同一个视觉骨干下对比三个模型并额外加入一项显式的本体感受奖励鼓励末端执行器对齐目标位置。方法同一视觉骨干Bi-DexHandsPerAct²总体Ag2Manip本体感受有限68.5%41.3%53.8%Ag2x2-H部分整合70.4%46.0%57.3%Ag2x2完整整合88.9%52.4%69.2%加不加本体感受奖励三者的排序与主表完全一致。这干净地说明增益来自预训练期注入的手部信息而不是策略学习期的本体感受。轨迹质量论文还用两个指标刻画生成轨迹的质量方法平滑度 $\gamma_s$越低越平滑进度一致性 $\rho$越高越单调VIP1.580.210Ag2Manip1.360.504人工奖励1.11—Ag2x2-H1.230.514Ag2x21.150.516平滑度数值是两条末端执行器加速度的累积量越低表示运动越平滑。Ag2x2 的 1.15 仅次于人工奖励的 1.11明显优于最强基线 Ag2Manip 的 1.36。进度一致性用时间序列与目标状态相似度之间的斯皮尔曼秩相关衡量Ag2x2 以 0.516 居首。这里也有一个需要注意的边界按按钮任务的成功率是 100%相关系数却是负的原因是按钮变色这类离散状态跳变会让相关性指标失真。定性结果与模仿学习图 3双臂操作定性结果。六类代表性任务挥杯、合剪刀、推箱、方块入微波炉、按按钮、扫灰尘自左向右的时间序列方法为两条末端执行器生成协调轨迹再经逆运动学转为两条 Franka 的关节指令。图 4模仿策略的泛化。仅用 Ag2x2 自主采集的 12 条绳整直轨迹训练模仿策略即可在未见过的初始构型绳索弯曲方向与训练相反上完成整直并适应可变形物体的持续形变。结果对比总结图 7结果对比总结Mermaid 图。Ag2Manip 的 56.4% 与人工奖励的 63.2% 汇聚到 Ag2x2 的 73.5%去掉手部坐标后掉到 57.3%而整体比人工奖励高出 10.3 个百分点。关键发现手部坐标是承重项不是锦上添花。去掉双手的 2D 坐标后平均成功率从 73.5% 掉到 57.3%正好 16.2 个百分点而消融版57.3%与 Ag2Manip56.4%几乎持平说明这部分增益来自信息本身而非架构变化。零样本可以超过人工奖励。Ag2x2 的 73.5% 高于人工设计奖励函数的 63.2%10.3 个百分点也高于同族 Ag2Manip 的 56.4%17.1 个百分点——而它不需要任何示范或奖励工程。可变形物体不再需要专用设计。在「整直绳索」这类传统难题上Ag2x2 无需专用奖励或示范即可学会13 个任务里只有「方块入微波炉」低于 50% 成功率。增益来自预训练不来自本体感受。在加入显式本体感受奖励的控制实验中Ag2Manip 53.8%、Ag2x2-H 57.3%、Ag2x2 69.2%排序与主表完全一致把两个混淆变量干净拆开。轨迹质量同步提升。平滑度 1.15 仅次于人工奖励的 1.11、优于最强基线 Ag2Manip 的 1.36进度一致性 0.516 为全部方法最高。表征还能反过来生成数据。仅用 12 条自主采集的绳整直轨迹训练模仿策略就能泛化到弯曲方向与训练样本相反的未见构型。局限性论文自己把边界说得很清楚主要有四点目标被压成一张静态图。缺少中间轨迹状态因此无法支撑「中间动力学关键」的任务。比如「把球扔进桶里」如果目标图只显示球在桶中系统会试图直接把球放进去而不是抛投。不可观测动力学的任务仍然无解。例如微波炉内部状态没有视觉反馈时任务依旧困难。只建模末端执行器位置。因此只适用于简单夹爪无法覆盖多指灵巧手的关节级手指协调。任务范围受限。13 个任务全部是单阶段、夹爪可完成的仿真任务多阶段任务被直接排除在框架之外。作者提出的缓解路径是用高层规划器生成中间的视觉与运动学步骤而把表征扩展到灵巧手则需要重新理解手指之间的协同——作者认为「预训练于现成人类视频」这条路仍然是更省数据的方向。常见问题FAQAg2x2 和 Ag2Manip 的核心区别是什么Ag2Manip 把人类区域整块抹掉让表征只关注物体状态变化同时把具身信息一并删除Ag2x2 同样抹掉人的外观但保留双手的 2D 坐标。区别只有这一处但它把平均成功率从 56.4% 拉到 73.5%。为什么「只留手的位置」就能跨过人机形态差因为可迁移的是坐标而不是外观。手在哪里、如何相对运动这类空间关系对夹爪同样成立手长什么样、关节怎么配置则完全绑定人类形态。论文的取舍正是切在这条分界线上。这个方法需要专家示范或者奖励函数吗都不需要。手部坐标由现成的人类视频管线自动产出HaMeR 检手、ODISE 分割、E²FGVI 修复策略的奖励直接来自视觉表征的相似度。整条流程里唯一的「监督」是时间对比学习本身。训练一个技能要多少算力表征学习分两段视觉适配 40 小时 × 4 张 A100手部位置整合 20 小时 × 8 张 A100。策略侧用 PPO每个操作技能在单张 3090 上约 3 小时即可完成。为什么不直接用 LLM 生成奖励论文对比了 Eureka关闭人类反馈它的总体成功率只有 15.4%。LLM 生成的奖励只在目标状态容易描述的任务上有效比如合剪刀、按按钮一旦任务需要两只手在时序上配合就迅速失效。这个方法目前学不会什么三类任务需要中间动力学过程的比如抛投、内部状态不可观测的比如微波炉、以及需要多指灵巧手关节级协调的。此外多阶段任务被框架直接排除。阅读原文时有哪些容易踩的坑有两处值得留意。第一是表格数字自相矛盾主表中 Ag2x2-H 在 PerAct² 上的逐项成功次数合计 31对应 49.2%但印刷的平均值写的是 46.0%而本体感受对照表里同一行的逐项次数是 29恰好对应 46.0%。两表的逐项数据不一致引用时应以各自表格的逐项数值为准。第二是公式符号笔误轨迹平滑度公式用的是 $\gamma_s$但正文叙述里写成了 $\gamma$ 加花括号 s。这两处都不影响结论但在做复现或引用时容易被绊住。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2507.19817项目网站含视频、代码与预训练检查点https://ziyin-xiong.github.io/ag2x2.github.io/代码仓库https://github.com/ziyin-xiong/Ag2x2前作 Ag2ManipIROS 2024智能体无关表征的上一棒https://arxiv.org/abs/2404.17521R3MCoRL 2022智能体感知人类视频表征https://arxiv.org/abs/2203.12601VIPICLR 2023价值隐式预训练视觉奖励与表征https://arxiv.org/abs/2210.00030EurekaICLR 2024用大语言模型生成奖励https://arxiv.org/abs/2310.12931给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件