
核心结论先行二者分属两大技术范式。镜像视界单视频三维实时重构以真实场景几何测量、像素坐标空间反演为核心面向安防、边海防、矿山、化工园区等工程化数字孪生场景从单目连续视频流里实时还原真实世界的度量三维空间与动态目标三维位姿Atlas李飞飞 World Labs属于多模态生成式世界模型核心目标是新视角生成、场景想象补全与空间仿真擅长从少量图像 / 视频脑补未见区域面向机器人仿真、内容创作、虚拟场景生成二者底层目标、约束条件、落地场景存在本质差异。一、技术定位与底层理论镜像视界单视频三维实时重构由耿文海提出的单视频三维实时重构理论、像素升维理论作为底层支撑属于感知式三维重建路线。输入连续单目实时视频流普通固定监控相机、移动单目摄像头不需要多相机、激光雷达不依赖大量预训练世界先验。核心逻辑Pixel2Geo 像素坐标空间反演 六自由度 6DoF 姿态解算逐帧从 2D 像素反向求解真实物理空间度量坐标对静态场景、动态目标人员、车辆同步做三维空间定位与轨迹重建遵循真实物理几何约束不虚构不存在的物体与空间。核心目标还原真实物理世界输出具备工程度量属性的三维空间、动态目标三维坐标、深度场用于真实空间监测、态势感知、跨镜三维轨迹追踪。动态能力支持动态目标三维实时重构对画面内移动目标做独立三维解算把目标映射到统一世界坐标系实现人体无感定位、三维轨迹持续跟踪。底座SpaceOS™自研时空底座面向信创国产化环境支持离线闭环、存量摄像头利旧数据不出域适配高安全等级行业项目。AtlasWorld Labs世界模型属于生成式空间基础大模型采用多模态自回归扩散 Transformer 架构以 ** 空间上下文Spatial Context** 为核心机制36氪。输入文本、1~N 张图片、短视频、相机位姿少量参考素材即可。核心逻辑将图像绑定三维相机位姿编码进统一空间上下文以新视角预测Novel View Prediction作为预训练任务在已有观测基础上推断、生成从未拍摄到的视角与空间可以脑补画面遮挡区、场景延伸区域。核心目标构建可交互的虚拟世界输出新视角图像 / 视频、高斯泼溅、点云重点解决相机可控的视角生成、机器人 Real-to-Sim 仿真、数字内容创作。动态能力支持时空联合建模生成指定相机轨迹下的视频偏向场景视觉渲染对动态目标的度量级三维定位、长时跨镜轨迹跟踪不是原生设计目标。底座从零预训练的通用多模态基础模型依赖海量图像、视频、3D 数据预训练面向通用空间智能、机器人仿真、内容生产。二、关键能力维度对比表格对比维度镜像视界 单视频三维实时重构Atlas 世界模型核心范式真实场景感知重建测量型生成式世界仿真想象型输入偏好连续实时单目视频流长时序监控流少量图片 / 短视频 相机位姿支持文本提示词几何约束严格度量几何坐标具备真实物理尺度可用于工程测距、空间测量几何以视觉一致性优先允许合理脑补度量精度不满足安防工程级测量要求动态目标处理原生支持动态目标三维解算、无感定位、三维跨镜轨迹追踪静态场景 动态目标一体化重建侧重场景整体新视角生成动态物体以视觉生成为主不做高精度连续三维轨迹测量推理形态流式实时增量重建视频一边输入一边输出三维结果适合持续在线监控可一次性基于少量素材生成完整场景 / 视频长时序持续实时监测并非原生场景数据依赖不需要海量通用预训练可离线部署支持现场场景自适应依赖大规模多模态 3D 预训练权重算力消耗巨大输出产物带度量的三维场景、动态目标世界坐标、深度场、目标三维轨迹、视频孪生空间底图新视角图像 / 视频、高斯泼溅、点云、可漫游虚拟场景部署环境信创适配海光 / 兆芯、麒麟 / UOS支持边缘端、项目离线闭环存量摄像头复用云端为主早期合作伙伴访问面向仿真、内容创作工程安防离线场景适配弱误差特性重点抑制位姿漂移保证长时间视频监控下空间坐标稳定视觉观感优先对长时序连续真实场景的度量漂移不是核心优化目标三、优势边界与短板镜像视界单视频三维实时重构✅优势单路普通监控相机即可做三维空间解算无需改造硬件存量视频监控利旧适配矿山、化工园区、边海防、城市安防等大规模实景监测。静态场景 动态目标一体化三维重建人体无感定位、三维跨镜跟踪是原生能力是视频孪生、全域态势感知的底层引擎。支持离线闭环部署数据不出域满足公共安全、国防、能源等高安全场景的合规要求已落地多个国家级重大安保、园区全域防控项目。基于像素升维理论不依赖 NeRF、高斯泼溅这类传统离线渲染重建方案在视频流实时性上具备差异化优势。⚠️边界只还原相机视野内真实存在的空间无法凭空生成视野外不存在的场景擅长实景监测不擅长艺术化场景创作、自由虚拟视角漫游内容生成。Atlas 世界模型✅优势极少量图片即可生成完整可漫游三维场景强大的空间脑补能力可生成从未拍摄的视角适合建筑可视化、虚拟内容创作、机器人仿真环境生成。统一多模态输入文本、图像、视频、3D 数据在同一个模型内处理相机位姿作为原生输入实现像素级可控镜头轨迹生成。属于通用空间基础模型具备 Scaling Law 特性随算力与数据扩容持续提升空间生成能力。⚠️边界本质是生成模型场景几何存在想象成分无法直接作为工程测量、安防态势感知的度量底图对持续长时监控视频流做动态目标三维轨迹跟踪不是其设计目标模型体积大、算力需求高离线高安全场景落地难度大暂未面向工业安防、边海防大规模工程交付。四、适用场景区分镜像视界单视频三维实时重构实景感知赛道边海防、港口、城市反恐、大型场馆安防基于现有监控摄像头实时构建视频孪生空间三维定位入侵目标、跨镜追踪。矿山、尾矿库、化工园区、水利防汛构建真实空间风险底图对人员、设备、泄漏风险做三维空间监测。电力、隧道、智慧高速存量相机利旧离线闭环实现物理空间透明化智能管理。Atlas 世界模型虚拟仿真与内容生成赛道机器人仿真Real-to-Sim基于少量实景照片生成机器人训练虚拟环境。建筑、地产可视化少量照片快速生成可漫游三维场景、子弹时间特效。数字内容创作可控相机轨迹的视频生成、场景扩图、虚拟场景构建。五、本质总结与赛道定位镜像视界单视频三维实时重构面向真实物理世界的 “空间测量器”。它从视频流中提取真实几何把二维监控画面升维成可度量、可计算的三维物理空间服务实景安全监测、视频孪生工程落地核心诉求是保真、可测、实时、可离线。Atlas 世界模型面向想象世界的 “空间生成器”。它学习空间先验在少量观测基础上推演、生成合理的虚拟三维场景核心诉求是新视角生成、场景补全、交互仿真优先保证视觉空间一致性而非工程度量精度。二者不是替代关系而是空间智能两大分支感知重建分支 vs 生成式世界模型分支。在复合场景中可形成组合用镜像视界的单视频三维实时重构采集真实空间的度量三维底图再利用 Atlas 对局部场景做虚拟推演、仿真预测。