、与TVBI(把选择结果写进记忆里)的单目具身视觉跟踪)
前言关于智能跟随一直是机器人的一个重要课题本博客中之前也解读过类似的框架比如TrackVLA与其plus升级版——开放世界下的四足具身视觉跟踪EVT(智能跟随)集目标识别与轨迹规划为一体的VLA不怕高动态与遮挡Uni-NaVid(NaVid升级版)——基于视频和指令规划动作通过在线Token合并和前瞻性预测试图一统“智能跟随”等4类导航任务考虑到我司「七月具身」最近新签的一个合同 又涉及到了“智能跟随”功能的开发虽然之前搞过智能跟随但更好和优化总是无止境的故在继续探索的过程中关注到了本文要介绍的ReferTrack一种在单个前向摄像头条件下实现EVT 落地的” 指代-再跟踪” 范式。该模型首先从一个索引化的边界框集合中选出目标然后在这一基于图像决策的条件下解码跟踪航点EVT 是 Embodied Visual Tracking 的缩写中文通常译为具身视觉跟踪。在这篇文章中它指机器人只依靠自身搭载的摄像头根据自然语言描述识别目标人物并持续规划运动轨迹进行跟随。例如指令是“跟着穿黑色 T 恤和短裤的人”机器人需要同时完成两件事目标识别从多个人中找出正确的目标轨迹规划控制自身移动与目标保持合适距离同时避免碰撞简单来说EVT 就是让机器人做到“听懂要跟谁、在画面中认出谁、并亲自移动着跟上谁”为在时间上保留目标运动线索ReferTrack 维护一个先前所选边界框的滑动窗口队列并通过时间-视角-边界框指示符TVBItoken 将它们的几何特征注入视觉历史中第一部分 ReferTrack: Referring Then Tracking for EmbodiedVisual Tracking1.1 引言与相关工作1.1.1 引言具身视觉跟踪Embodied Visual Tracking, EVTTrackVLATrackVLAAD-VATEmpowering Embodied Visual Tracking with Visual Foundation Models and Offline RLInstance-Level Visual Active Tracking with Occlusion-Aware Planning2026面向实例级视觉主动跟踪引入遮挡感知规划以改善目标短暂不可见时的持续跟随能力]要求一个移动智能体在仅依赖机载视觉的条件下持续跟随由自然语言描述的特定目标。在拥挤且动态的环境中成功关键在于两种紧密耦合的能力目标识别——判断哪一位行人符合给定指令以及轨迹规划——生成避免碰撞的运动轨迹同时将目标保持在合适的跟随距离内具体而言早期的处理流程通常将这两个阶段分开处理利用视觉基础模型6-Segment Anything7-SAM 28-Grounding DINO详见本博客中的解读《IDEA-Research推出的一系列检测、分割模型从DINO(改进版DETR)、Grounding Dino、DINO-X到Grounded SAM2》进行目标识别再采用后续的基于学习的规划器进行导航 [4,5]最新的视觉-语言-行动vision-language-action, VLA模型将目标识别与路径规划统一到一个单一策略中并采用大语言模型LLMs1,29-NavFoM10-CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models11-Uni-NaVid12-VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory13-ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation的“下一 token预测”范式一些方法 [9,10,11,12,13]将EVT与其他导航任务例如视觉-语言导航[14-Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments]目标物体导航 [15-HM3D-OVON]点目标导航 [16-SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation]进行联合训练使模型能够学习通用的导航先验并仅凭海量数据就获得基础的 EVT 能力相比之下专门化方法 [1,2] 则专注于 EVT 和以目标识别为驱动的问答QA数据集构建。通过显式地针对识别与规划进行优化它们在只需少量训练数据的情况下就能取得相当甚至更优的性能在此基础上TrackVLA [2] 通过在动作预测之前引入具备空间感知能力的 token加入链式思维chain-of-thought, CoT推理————然而只在抽象的空间潜在空间中进行推理往往难以在复杂、拥挤的场景中实现精确的视觉对齐visual grounding为了解决这一问题来自的研究者提出了一种互补的范式先指代referring再跟踪tracking。即并非依赖抽象的空间编码而是将目标识别表述为从自我视角图像中检测到的一组图像空间边界框bboxes中选择一个带索引的条目这样就把识别问题转化为一个受约束的多选问题 [17-Referring to Any Person]更易于监督训练也更符合 VLM 的语义对齐grounding机制在这一表述基础上作者提出了ReferTrack其paper地址为ReferTrack: Referring Then Tracking for Embodied Visual Tracking其GitHub地址为github.com/MedlarTea/referTrack——截止到26年9月中旬下述第一项已发布其余项待发布Release model checkpoints and evaluation code.Release the dataset.Release the training code.Release the data engine.具体而言这是一种 VLA 模型它将当前检测结果组织成一个带索引的 bbox 目录预测单个 Refer-CoT token包括⟨NO EXIST⟩并通过滑动窗口队列传播所选目标的 bboxes在轨迹预测之前注入运动线索Refer-CoT单 token 的目标指认Refer-CoT可以理解为一种压缩到只有一个特殊 token 的“指认推理”。在当前帧 T 模型先从候选目录中选择一个目标例如输出⟨ped_2⟩说明语言指令描述的是当前第 2 个候选行人输出⟨NO_EXIST⟩说明目标当前不在视野中它不是一段自然语言 Chain-of-Thought而是一个离散候选索引 token。第一个 LLM 先生成它第二个 LLM 再把它作为条件前缀来生成动作一句话概括Refer-CoT 回答“现在应该跟谁”为了在在线跟踪之前进一步增强这种指代能力作者在一个自构建的 Refer-QA 数据集上对 ReferTrack 进行联合训练——该数据集源自一个行人ReID数据集 [18-PLIP: Language-Image Pre-training for Person Representation Learning]——并采用与上述相同的带索引 bbox 选择接口因此ReferTrack 建立了一条紧凑的、以图像为基础的 CoT 通路将自然语言、视觉检测和运动线索无缝集成到一个端到端策略中1.1.2 相关工作首先对于视觉-语言导航视觉与语言导航Vision-and-language navigation, VLN要求智能体在自然语言指令的引导下到达指定目标。早期方法利用场景的文本描述对现成的大型语言模型LLMs进行提示式调用 [19-LM-Nav,20-NavGPT]而最近的模型则在导航轨迹上对视觉-语言模型VLMs进行端到端微调 [11,21-NaVid,22-NaVILA,23-StreamVLN,13]例如Uni-NaVid [11] 通过跨任务模仿学习泛化的导航能力NavFoM [9] 则通过时间-视点指示temporal-viewpoint indicator, TVItoken 对视觉历史进行结构化建模从而显式编码时空上下文ReferTrack 延续了这种结构化视觉历史建模思路但进一步通过时间-视点-边界框指示temporal-viewpoint-bboxindicator, TVBItoken 注入被指称目标的几何特征。一旦通过 Refer-CoT token 完成目标识别其历史边界框就会被排队并进行融合进入视觉流——TVBI全称是Temporal-Viewpoint-Bbox Indicator是在 TVI 的基础上加入目标 bbox 几何信息论文中的定义是其中表示这一帧的时间和视角信息该历史帧中被引用目标的归一化边界框把 bbox 映射到 LLM 可理解的隐空间如果历史帧中目标不可见就使用作为明确的“目标缺失”标记TVBI 只用于历史帧当前帧仍然只使用 TVI不直接注入当前 bbox。这样模型必须利用“历史目标几何 当前原始视觉”重新定位目标而不是简单复制上一帧答案。一句话概括TVBI 回答“过去那个目标在哪里它是怎么移动的”——————该机制有效地将通用的时空索引转化为一种以目标为条件的记忆用于持续跟踪我再用一个表格帮大家总结下TVI与TVBI的本质区别对比维度TVITVBI本质差异全称Temporal-Viewpoint IndicatorTemporal-Viewpoint-BboxIndicatorTVBI 多了 Bbox编码对象时间顺序 视角信息时间顺序 视角信息 目标边界框从“组织历史”升级为“记住目标”论文公式TVBI 把目标几何直接加进指示 token是否知道目标位置不知道知道历史帧中的目标 bbox这是两者最核心的区别是否绑定具体目标不绑定只描述帧的时空上下文绑定 Refer-CoT 选中的目标TVBI 是目标条件化记忆bbox 来源无Refer-CoT 选中候选后写入历史 bbox 队列TVBI 依赖“先指认”的结果目标缺失时不涉及使用 [0,0,0,0] 表示该历史帧无可靠目标框能区分“目标移动”与“目标缺失”在 ReferTrack 中的位置当前帧仍使用 TVI-only历史帧使用 TVBI当前帧不直接注入 bbox迫使模型重新定位目标解决的问题让模型理解帧与帧的时间、视角关系让模型理解“被选目标如何随时间移动”从通用时空索引变成跟踪记忆其次对于具身视觉跟踪具身视觉跟踪Embodied Visual Tracking, EVT要求一个移动智能体持续追踪由自然语言指定的动态目标早期方法通常将感知和控制解耦将视觉基础模型 [6,8] 与后端的强化学习或模仿学习[24-Towards Distraction-Robust Active Visual Tracking2021通过多智能体混合博弈等机制提升主动视觉跟踪在外观相似干扰者存在时的鲁棒性,4] 进行组合尽管这类模块化流水线在可解释性上具有优势但识别阶段的错误不可避免地会累积并传递到规划模块近期的 VLA 模型则将语言、视觉与控制统一起来以解决 EVT 问题 [1,25-LOVON,2,10]TrackVLA [1] 将目标识别与轨迹规划整合为单一策略LOVON [25] 采用分层式LLM 规划器并配合低层控制器TrackVLA [2] 在利用极坐标 token 进行航点预测之前引入时序记忆和具备空间感知的推理机制ReferTrack 同样采用“先推理、后行动”的范式但其推理所使用的词汇是在已索引的图像空间 bbox 之间进行选择而非抽象的极坐标这样的设计与 VLM 自然使用的、以及机载检测器输出的以 bbox为中心的表征形式显式对齐从而将推理过程锚定在直接的视觉证据之上并最大限度地减少由抽象带来的瓶颈最后指代、定位与基于目录的识别指代表达理解Referring Expression Comprehension,REC基于自由形式的自然语言对目标进行定位 [26-ReferItGame,27-RefCrowd]开放词表检测器和定位grounding模型 [8,28-Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V] 进一步在语言与图像区域之间建立桥梁并且愈来愈多的多模态大模型multimodal LLM被设计为将边界框bbox作为 token 输出或在候选区域提议之间进行选择29-Shikra30-Ferret31-Groma32-ChatRex33-LISA在以人为中心的场景中像 RexSeek [17] 这样的框架可以检测出所有与给定描述匹配的个体这启发了作者的 Refer-QA 协同训练即在离线阶段强化基于目录的指代表达能力并将这一能力迁移到在线 EVT 跟踪中总体来看这些工作表明从离散候选中进行选择是视觉-语言模型VLM的自然交互方式。更重要的是将 EVT 识别表述为在带索引的图像空间边界框之上的指代任务也解锁了稀缺的专家级跟踪轨迹之外的监督信号互联网提供了大规模的指代与定位数据 [26,8,17]而机器人学 [34,35] 和自动驾驶 [36,37] 则提供了大量带有二维行人标注的自中心视频可以用来填充候选目录这种兼容性为在 EVT 驱动的视觉-语言智能体VLA中扩展识别能力提供了一条可扩展途径而无需完全依赖昂贵的闭环导航数据在本文中为了与先前 EVT 工作 [1,2] 进行公平比较作者使用相同的人体重识别person ReID数据集[18] 来生成 Refer-QA 数据并将由此学到的带索引 bbox 选择能力迁移到在线跟踪中1.2 ReferTrack的完整方法论涉及模型架构1.2.0 问题表述与概述首先是任务表述具身视觉跟踪EVT要求一个移动智能体仅依靠机载视觉持续跟随由自然语言描述的特定人物这一能力是建立长期陪伴关系和具备社会感知交互的基础在每个时间步给定关于目标外观的指令和一串前向视角的RGB 观测智能体预测一条连续轨迹每个航路点表示在地面平面上的自中心位移和朝向变化遵循既定的评估协议当智能体在保持规定的跟随距离1-3 米的同时将目标持续保持在其视野内时该回合被视为成功其次对于模型概述ReferTrack 将最新的VLA 框架[1, 2, 9] 扩展为一个为同时执行导航和问答而定制的双分支架构对于导航作者使用鲁棒的视觉编码器和跨模态投影器[38] 对前视观察历史进行编码以获得视觉token然后使用受NavFoM 风格TVI 编码[9] 启发的时序-视角-边界框指示符TVBItoken 对其进行结构化与此同时时间步T 的行人检测结果被组织成一个带索引的候选目录。每个条目对应一个通过基于MLP 的投影器P bbox 编码的检测到的行人边界框。指令按照标准多模态训练实践被token化为语言嵌入视觉tokens、catalog 和 language tokens 被连接起来并在两阶段顺序地输入到一个大型语言模型中其中 E 指的是 T ∈ {⟨ped1⟩, . . . , ⟨pedK⟩, ⟨NO EXIST⟩}用于选择一个带索引的 bbox 条目。其中的 ⟨NO EXIST⟩该 token 明确表示当前前向视野中不存在目标作者采用这种图像空间的指代策略——选择与匹配的索引 bbox 条目——因为它通过一个紧凑的单 token 选择——即Refer-CoT将目标识别与 VLM 的指代/对齐机制自然衔接在一起对于问答任务作者复用同样的目录接口引导模型基于自构建的 Refer-QA 数据集选择与目标描述相匹配的索引 bbox 条目导航数据与 Refer-QA 样本进行联合训练。图 2 总结了完整的 EVT 推理流程的ReferTrack 首先通过从当前检测结果中选择一个带索引的边界框bbox对语言指令和视觉流进行对齐与关联然后在该 Refer-CoT 决策的条件约束下预测跟踪航点。被选中的边界框会作为目标特定记忆进行存储并通过 TVBI token注入到后续的视觉历史中1.2.1 ReferTrack 架构观测编码、候选目录、Refer-CoT和轨迹预测、引用目标边界框队列、训练目标等第一对于观测编码作者处理在线前视流采用双编码器架构从SigLIP [39] 和DI-NOv2[40] 中提取并拼接视觉特征之后应用grid pooling 策略[21] 生成细粒度tokens以捕获当前观测的细节信息以及粗粒度tokens以保留更广泛的历史上下文其中C 表示通道维度为在长程上下文和推理延迟之间取得最佳平衡维护最近H 帧的滑动窗口因此视觉流被组织为一个两层MLP 投影器将视觉流映射到LLM 潜空间生成在输入LLM 之前作者在帧视觉token 组之间交错插入时间-视角-边界框指示符TVBItokens从而将目标几何显式注入到视觉历史中给定一个有效的归一化框然后通过共享的两层MLP对其进行嵌入(稍后在目录编码中复用)并将其加到TVI token 上[9]——定义为公式2如果在历史帧中目标未被观测到作者将设为一个确定性的缺失哨兵这表明该帧没有可靠的目标几何信息可用从而使TVBI 能够区分可见的目标运动和目标缺失的历史在导航过程中长度为H 的参考目标边界框队列对历史TVBI 流进行显式条件建模而当前帧的精细token 严格依赖仅由TVI 提供的指示信息通过剥夺在当前观测中不再显式注入边界框的情况下模型被迫只能依赖历史 TVBI 线索和原始视觉特征对目标进行空间和时间上的定位从而为后续的指代表达任务建立稳健的表示第二对于候选目录图像空间中的指代表达需要在每个步骤为 LLM 提供一组离散的行人候选以供评估 [17]。在时间步 T作者在当前前视图图像上运行一个现成的实时目标检测器 [41]。检测到的行人会被整理为一个带索引的目录 C_T {⟨ped1⟩, …, ⟨pedK⟩, ⟨NO EXIST⟩}如果场景中包含的行人数超过 K 个作者会根据边界框面积优先选择前 K 个候选此外还会始终包含一个固定的虚拟索引 ⟨NO EXIST⟩用于处理指令目标在智能体周围环境中完全不存在的情形为了将格式化为适用于LLM 的形式每个候选条目由一个专用的标识符token后接一个bbox token 来表示对于一个有效的归一化框bbox token 通过计算采用与式(2)中定义的相同P bbox 结构在建立了视觉历史和离散候选空间之后LLM 融合语言指令以选出真实目标。最终模型通过自回归的下一个token 预测输出对应的候选索引即Refer-CoT token E referT第三对于Refer-CoT和轨迹预测给定指令、候选目录和自中心视觉历史ReferTrack 在运动规划之前显式地对目标进行指代定位在第一次LLM 前向传播Eq. (1)中模型通过在已注册的特殊token离散词表上进行分类步骤生成单个Refer-CoT token{, ⟨NO_EXIST ⟩}关键在于目标选择始终是对索引边界框的一次单token决策从而使推理步骤保持紧凑并可被直接监督。若目标不可观测模型预测⟨NOEXIST ⟩否则它输出与最匹配的索引随后LLM 使用作为条件前缀生成一个动作token一个专用的MLP 头将其解码为个航点第四对于引用目标边界框队列一旦被解析就从中提取相应的边界框bbox来自选定的目录条目并将其压入一个容量为的先进先出FIFO队列 Q 中用于未来的历史编码在第 T 步时当前观测本身仍然是仅 TVI而历史 TVBI 流则以之前的队列作为条件在第 T 步的Refer-CoT决策中新选出的 bbox会被追加到队列末尾形成供下一个时间步使用的队列。在训练阶段队列 Q 使用真实标注的跟踪数据进行填充为增强鲁棒性作者通过偶尔注入一个错误的目标索引例如另一个行人或 ⟨NOEXIST⟩来引入随机噪声从而有效地模拟历史跟踪误差在推理阶段队列则以内推自回归的方式更新每一步都使用 Refer-CoT 选出的 bbox。正如在观测编码中所设定的这些存档的坐标只会被历史 TVBI token 消费而不会被当前帧的 fine token 使用这一显式记忆机制闭合了推理环路Refer-CoT 决定“跟踪谁”而队列则将这一决策传播到几何历史中用以锚定所有后续的规划第五对于训练目标为了将视觉-语言推理与机器人控制紧密结合Refer-Track 采用全量微调策略同时更新整个大语言模型LLM的参数以及辅助的视觉和动作模块整体框架通过三个不同损失函数的加权和进行优化其中是一个设置为10 的常数缩放因子对于导航轨迹通过最小化预测航路点与专家航路之间的均方误差MSE来监督动作头L refer 项监督Refer-CoT 推理步骤通过交叉熵训练模型去预测真实的目标索引E refer,gtT∈{⟨ped1⟩, . . . , ⟨pedK⟩, ⟨NO_EXIST ⟩}最后对于Refer-QA 样本L text 在文本token 上计算标准的交叉熵。该损失有意绕过action head以使梯度更新完全专注于视觉指称和语言对齐1.2.2 训练ReferTrack 在两个互为补充的数据集上进行训练这两个数据集共享统一的索引边界框indexed-bbox目录表示形式Navigation data 包含 130 万条专家跟踪轨迹这些轨迹是从 Habitat 3.0 模拟器 [42] 中 EVT-Bench 训练划分 [1] 精选而来每个样本提供前视观察、自然语言目标描述、基于检测的候选目录、真实的 Refer-CoT 索引以及专家路径点Refer-QA data 融合了 130 万条自定义构建的指代样本这些样本由 SYNTH-PEDES [18] 合成而来——该数据集与以往 EVT 方法 [1,2] 使用的数据完全相同——以显式增强视觉指代表达visual grounding能力最终作者按照 1:1 的比例对这两个数据源进行联合训练并遵循 TrackVLA [1] 中的两阶段有监督微调Supervised Fine-Tuning,SFT方案第 1 阶段使用通用的多模态问答数据集 [38,43] 对视觉投影器进行对齐第2 阶段在共享的输入布局下对导航任务和 Refer-QA 任务同时进行全量微调由于这两个任务在语言指令、离散目录以及组织化视觉 token 的顺序上完全一致因此从静态问答监督中学到的稳健指代能力能够无缝迁移到动态的在线跟踪中。更多细节见附录首先对于专家跟踪数据整理作者从Habitat 3.0 [42] 中的EVT-Bench 训练划分[1] 获取专家跟踪轨迹。由于以往的专家轨迹筛选流程仍为专有作者实现了一个自定义的oracle 控制器该控制器可以访问机器人和被指示的人形目标的模拟器状态在每个仿真步控制器从机器人到目标查询Habitat的测地线最短路径规划器对返回的路径进行加密并选择一个局部前瞻航点使机器人保持在偏好的跟随距离1.2 m 附近当目标经过大转弯时控制器切换为追逐路径中的中间点当目标接近机器人或机器人过于靠近时它会在机器人后方计算一个后退目标点以恢复跟随距离选定的局部目标由具有加速度平滑的PD 速度控制器进行跟踪生成底盘差速速度指令作为航点/动作监督信号在执行 rollout 过程中作者逐步记录机器人和目标的位姿、专家的底盘速度以及从全景分割观测中提取的目标边界框bbox只有当 Habitat 的跟随指标在整个过程中始终保持成功、且无碰撞或长时间目标丢失时该回合才会被接受作为专家示范失败的rollout 则会单独存储以便检查具有代表性的专家行为如图 4 所示在指令“跟踪穿着红黄相间超级英雄服装的人。”的条件下oracle 控制器展现出多样的跟随行为包括当目标接近时后退、在大转弯处追踪中间航路点、正常的后侧跟随以及在目标停止时随之停止从左到右————作者将整理后的成功轨迹下采样至 33 万个样本用于单目标跟踪Single-Target Tracking, STT和歧义跟踪Ambiguity Tracking, AT并保留所有 64 万个分心跟踪Distracted Tracking,DT样本以在存在干扰的情况下提升目标识别能力最终共得到 130 万个导航样本其次对于Refer-QA 数据生成作者将辅助监督形式化为一个结构化的refer-QA 任务以反映在线目录界面。为了与先前的EVT 方法[1, 2] 进行公平对比作者使用相同的SYNTH-PEDES [18] 数据集来生成他们自己的refer-QA 数据示例如图5 所示作者通过将 2–3 个带有字幕的行人裁剪图像合成到多样化背景上来合成多人的指代表达样本并监督模型从中选择被查询的带索引边界框bbox或选择⟨NO EXIST⟩示例提示词对于图5中的第一张图候选库中包含索引 12对应 bbox [72,35,230,352]索引 17对应 bbox [253,41,376,288]以及一个缺失的负向描述对应的 bbox 为 [0,0,0,0]用⟨NO EXIST⟩表示一个正向查询为“Please find ⟨a man in his forties is wearing a white cap, white shirt, and a pairof black pants⟩ in the video. Answer with object indexes.” 其监督答案为索引 12对于每个样本作者裁剪背景图像的底部区域将其调整为384 × 384 大小并粘贴2-3 个具有随机尺度且尺度落在[0.75, 1.5] 内的行人裁剪图同时拒绝重叠的布局每个粘贴的行人都会被随机分配一个 0 到 19 的目录 ID并与其图像空间的边界框bbox和文本描述一起存储作者还为其附加一个在图像中不存在的负样本行人描述并用全零的 bbox 来表示在训练过程中有效的行人会被打乱后放入与导航任务相同索引的候选目录中并在末尾追加一个固定的虚拟 ⟨NO EXIST⟩ 槽位。指令提示为“Pleasefind⟨caption⟩in the video. Answer with object indexes.”模型在推理位置被监督去预测正确的 bbox 索引标记当查询的描述对应的是缺失的行人时则预测 ⟨NO EXIST⟩最后对于优化设置作者遵循已有的多模态预训练实践采用两阶段的SFT 策略在阶段1 中我们冻结语言模型和视觉编码器仅训练视觉投影器P vision 在通用QA 数据集[38,43] 上以学习率1 × 10−4 训练一个epoch在阶段2 中遵循TrackVLA [2]以1:1 的数据比例在导航和Refer-QA 任务上联合训练模型训练20 K 步使用全局batch size 为256在此阶段除视觉编码器保持冻结外所有参数均被更新。且采用带有余弦学习率衰减调度和线性预热的AdamW 优化器。具体而言LLM 的学习率设为2 × 10−5其余可训练模块包括投影器和动作头的学习率设为1 × 10−41.2.3 推理的更多细节(参考原文附录B)首先作者在 Unitree Go2 四足机器人和 Unitree G1 人形机器人上测试了 ReferTrack以评估其在不同具身形态中的真实环境表现如图 6 所示ReferTrack 部署在一台远程高性能服务器上。两种机器人平台均配备了一台单目前向摄像头Intel RealSense D455 摄像头以及一个便携式Wi-Fi 用于通信其次在部署阶段ReferTrack 作为一个 WebSocket 服务运行在远程 GPU 服务器上。机器人从Intel RealSense D455 相机连续地以 JPEG 压缩的 RGB 帧形式进行数据流传输并附带语言指令服务器对每一帧进行解码更新在线检测器/跟踪器构建带有索引的边界框bbox目录并返回预测的轨迹以及被选中的目标槽位为避免在网络抖动情况下产生过期的控制指令服务器在推理运行期间只保留最新一帧尚未处理的图像并丢弃“被更新请求所取代的”旧请求采用了多项工程优化以降低延迟首先模型检查点只在服务器启动时加载一次而每个机器人连接各自拥有独立的流式会话其次在开启该功能时作者使用torch.compile 对 LLM 进行编译并执行若干次预热步骤使得后续的在线推理能够达到稳定状态第三特征提取实现了并行化当前 RGB 帧的 DINO 和 SigLIP 特征在不同的 Python 线程中计算并运行在不同的 CUDA 流上只在特征拼接前进行同步。拼接后的特征随后通过网格池化被压缩为当前帧的 64 个细粒度 token以及历史的 4 个粗粒度 token在每个时间步粗粒度 token 会被推入一个固定长度的视觉历史队列而当前的细粒度 token 保持独立Refer-CoT 选出的 bbox 也会被追加到目标 bbox 历史队列中并且仅注入到后续的历史 TVBI token 里在机器人端一个纯追踪控制器pure-pursuit controller将预测轨迹转换为线速度和角速度控制指令// 待更