ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

1.69 万 GitHub Stars,这个具身方案爆火海外和学术圈。

1.69 万 GitHub Stars,这个具身方案爆火海外和学术圈。 今年4月一段用单目RGB相机实时重建三维空间的视频率先在海外开发者社区传开了。被马斯克、李飞飞、Jim Fan关注的泛AI创作者 Min Choi 则评价其**“这AI真够狂野的”。**头部内容创作者 AI DRIVR 在 X 上评价其仅依赖单目 RGB 相机、无需激光雷达即可实时运行且完全开源并感叹**“we’re living in the future”。**最近蚂蚁灵波的这项工作又迎来了来自学术界的认可。LingBot-Map的论文《Geometric Context Transformer for Streaming 3D Reconstruction》入选ECCV 2026 Oral 和 Award Candidates。“解决流式3D感知的基础问题吸收经典SLAM的思想同时保留前馈基础模型端到端学习和泛化的优势”。可以说在精度、效率和长程稳定性上都拿到了结果。原文链接1.69 万 GitHub Stars这个具身方案爆火海外和学术圈。01 3D基础模型从一次性重建场景走向持续维护“空间记忆”。想象一台机器人在仓库里巡检。它从货架一端出发绕过障碍进入另一片区域十几分钟后沿原路返回。出发时见过的门和转角早已离开当前视野重新经过那里时新的观测仍然需要和此前的空间对上。这要求模型一边处理新画面一边保留走过的路。行程越长需要维持的空间关系就越多。这些关系对端侧的智能体来说是很大负担。对人类来说我们不会记录每一帧的所有内容而是选择性地只保存最本质的线索以达到长时间内连贯地穿越大规模环境的目的。这就是LingBot-Map的思路选择性高效完成流式3D 重建。这种方式赋予了其可以在超大场景如大型物流中心中进行长时间、不间断的自主导航与巡检。而且也能让机器人厂商大幅降低对昂贵 3D 传感器的依赖。1 机器人走得越远记住空间就越难。机器人很难长时间穿越大规模环境这是长期存在的问题。虽然这几年VGGT、Depth Anything 3等前馈3D模型推动了一次性三维重建。在离线设置下模型可以同时看到一组多视角图像利用完整上下文预测相机位姿和场景几何。但这会产生一个问题陌生新环境下运行会很重所以更适合静态下的重建。追求速度的流式输入根本没有这个条件。第100帧到来时第101帧还不存在。模型只能利用已经看到的内容判断当前状态等序列延伸到几千帧最初的门、转角和楼梯虽然不在眼前仍可能是维持整条轨迹一致性的重要参照。但流式的重建逻辑也有个问题“历史压缩得太狠模型容易丢掉关键线索误差沿着轨迹积累”。保留接近完整的历史几何信息更丰富显存和计算量也会随之上涨。后者容易迷路前者像背着越来越重的相册赶路。2 大幅降低对昂贵 3D 传感器的依赖。之前大家做定位建图往往依赖激光雷达。这也是LingBot-Map的一个优势。只需要单目就能在10,000 帧的长序列里处理 518×378 分辨率的视频可以稳在 20 FPS 左右。这意味着普通相机就能成为重建三维空间的起点。机器⼈⼚商也可以⼤幅降低对昂贵 3D 传感器的依赖。成本和便利性都会有质的变化。而这个优势能形成究其原因在于LingBot-Map设计了一套独特的记忆系统。3 独特的记忆系统不再需要很大的内存。LingBot-Map的核心是Geometric Context Attention(GCA)设计了像人类一样的选择性记忆不试图记住所有细节也不轻易遗忘过去。这样可以节省宝贵的内存。如果细看GCA把空间记忆分成三个层次。Anchor Context记住出发点。模型先用最开始的几帧画面固定一套坐标和尺度。就像出发时先插下一面旗子后面所有位置都以它为参照不会越走越偏。Local Pose-reference Window记住眼前发生了什么。模型保留最近几帧完整画面通过门框、桌角、墙面等在画面中的相对移动判断自己刚刚走了多远、转了多少。这种运动视差就是单目摄像头从连续视频里获得的深度线索。Trajectory Memory记住走过的路线。更早的画面不必全部保存只压缩成一串轨迹记忆。当局部判断出现误差时可以利用压缩后的历史几何线索抑制误差在长序列中的持续积累。LingBot-Map的pipeline三者合起来让单目不再只是拍照片而是在持续观察、移动和对照中恢复三维空间。因此模型不需要像激光雷达那样逐帧测距也能从视频里的运动视差和长期空间记忆中推断几何关系。当然这种记忆不是无限的。轨迹记忆虽然比完整图像特征轻得多但视频越长历史仍会继续增长。因此超长视频还需要结合关键帧和分窗口处理。它减轻的是保存全部过去的负担并不是让历史信息凭空消失。4 序列变长误差没有跟着失控。这套记忆机制如何被检验一个很直接的方式是序列不断变长之后误差会不会持续累积论文中也看到在Oxford Spires测试中当序列从320帧增加到3840帧LingBot-Map的ATE只从5.37升至5.60增幅为0.23其他流式方法的增幅则在0.70到14.31之间。那记忆本身会因为特征减少保存而出现较大衰弱吗这也是LingBot-Map值得关注的点。相比保留全部历史图像特征GCA将显存占用从36.06GB降至13.28GB速度从11.87 FPS提升到20.29 FPSATE也从6.60降至5.98。也就是说历史信息并非保存得越多越好。在于过滤重复信息的同时留下维持长期空间一致性所需的几何线索才是关键。5 不只在demo上展示也让更多人用起来。相比于学术上的认可开发者的关注来得更早。仅几个月时间官方GitHub仓库获得了16,800 Stars、1,894 Forks也开始有人为它适配不同硬件、简化安装过程。一项重建模型逐渐进入了开发者自己的设备和工作流。单目输入、长序列处理和开源代码为开发者降低了上手和改造的门槛。开源的代码更能让开发者能够针对不同设备调整运行配置、封装安装流程、添加交互界面。02 极客们竟然把它适配到了各个平台了一个开源项目拿到上万Stars或者论文拿到Oral可能源于方法足够新、技术路径具备学术创新价值或是Demo足够抓眼球。有人愿意替它解决安装、硬件和交互问题说明开始流传了。LingBot-Map开源后许多开发者加入创作开发。有的制作了可以在Apple Silicon Mac上运行的原生桌面前端还配了一套3D点云查看器有的试图把原本复杂的配置过程压缩成一键安装并提供低显存启动方案。甚至还有开发者专门针对RTX 4060 8GB显存环境做适配。这让一项原本看起来更像实验室成果的模型能在更常见的消费级硬件上跑起来。这些适配逐项处理着论文之外的使用障碍也让 LingBot-Map 更容易进入开发者自己的设备与空间感知工作流。而在 LingBot-Map之前机器人还需要从二维图像中提取稳定的结构线索并恢复可度量的三维几何。蚂蚁灵波此前推出的 LingBot-Vision 和 LingBot-Depth对应的正是前面的两个环节。所以空间感知不是一个单点问题。上下游的分工很明确。03 空间感知更是一条从像素、几何到地图的技术链。技术逻辑上空间感知⾄少包含三个连续层次从⼆维画⾯中提取细致的空间结构、将视觉信息转化为具备真实尺度的⼏何测量、再把连续观测组织成⻓期⼀致的三维地图。这样一个任务机器人要从桌上拿起一只透明玻璃杯穿过房间和走廊把它送到另一个房间。对人来说这只是简单的抓取—移动—放置任务。对机器人来说却需要时刻面临三个连续问题。首先它得看清楚眼前的世界。玻璃杯的轮廓并不总是清晰可见杯沿、杯壁和桌面的边界可能相互重叠周围还有其他物体机器人需要判断哪些部分属于杯子哪些只是背景。如果连物体的结构都没有看清楚后面的抓取就无从谈起。这正是LingBot-Vision在解决的。但看清楚还不够。机器人还需要知道玻璃杯究竟离自己有多远夹爪应该伸到什么位置桌面和杯口分别处在怎样的空间高度。尤其面对玻璃、镜面、金属等材质时普通相机往往难以直接获得可靠的深度信息。于是问题从看清结构进一步变成了量准距离。LingBot-Depth 则通过 RGB 图像与深度信息之间的对应关系补足传感器缺失、噪声或不完整的几何信息把视觉线索转化为更接近真实尺度的空间测量。机器人因此不仅能识别杯子还能判断它在哪里、离自己多远以及怎样接近它更安全。然而任务并没有在机器人成功抓起玻璃杯的那一刻结束。它还要穿过房间、找到走廊、进入目标房间并把杯子送到正确的位置。机器人不能只依赖当前这一帧画面而要把一路上看到的环境组织起来刚才经过的门在哪里目标房间位于哪个方向自己是否已经走过了某个位置。这就从看清楚和量准确进一步进入了记得住。LingBot-Map 所做的正是把视觉和深度信息持续组织成一份可更新的三维空间记忆让机器人能够在移动过程中定位自己、重建环境并利用长期轨迹支持导航和任务规划。所以你看机器人真正需要的不是某一个孤立的感知模块而是一条逐步展开的技术链。04 写在最后LingBot-Map走出了一条很有意思的路径。先在海外KOL中引发关注。随后开源代码进入开发者社区GitHub获得超过1.69万Stars。如今论文又入选ECCV 2026 Oral。先被看见再被用起来最后走上顶会。但这些之外更值得关注的是背后还有一条正在形成的空间感知链路以及空间感知必须为行动负责的研发逻辑。只有当视觉信息被转换为可度量、可持续更新、可被规划和控制模块调⽤的世界表征机器人才真正具备在物理世界中行动的基础。
返回列表