ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

浙大国家重点实验室字节发布PointSplat:把人体重建压进一次前馈推理之后,重建路线还剩什么?

浙大国家重点实验室字节发布PointSplat:把人体重建压进一次前馈推理之后,重建路线还剩什么? 引子直播间里的一道难题想象一个沉浸式直播场景主播站在环形相机阵列中央成千上万的观众各自拖动自己的虚拟机位——有人想从侧后方看有人想凑近看表情。这要求系统在几秒内从稀疏的多视角图像里重建出一个可自由视点渲染Free-Viewpoint Rendering的真人三维表示。这个动机有出处——PointSplat 摘要的第一行就写着沉浸式直播系统需要即时生成三维人体表征且在算力与带宽受限时紧凑性与高保真同等重要。而传统三维高斯泼溅3D Gaussian Splatting3DGS的工作方式是对每个新场景现场跑几十分钟的逐场景优化Per-Scene Optimization。等它收敛完直播早就结束了。这就是浙江大学计算机辅助设计与图形学CADCG国家重点实验室与字节跳动被 ECCV 2026 接收的PointSplat要解的题。论文一作郭宇杰Yujie Guo当时还是实验室的一年级博士生。项目页与开源仓库地址已随论文公开页内附有交互演示代码与权重的完整发布进度以仓库页面实时状态为准。如果你对高斯、优化、前馈这些术语已经熟悉跳过下面这张卡片直接进第一节如果你刚接触这个领域这三分钟能帮你读懂后面的所有论证。给非技术读者的三分钟什么是高斯泼溅把一个人想象成由几十万个微小的半透明彩色棉球堆成的人形云。每个棉球有自己的位置、大小、朝向、颜色和透明度。渲染一个新视角就是把所有棉球从那个角度投影到屏幕上像画画一样叠出来。棉球越多、摆得越准画面越真。PointSplat 的两个关键动作是什么第一它先用一个小学手工课级别的技巧猜出人体轮廓把各相机拍到的人形剪影当作幕布几张幕布围出的公共部分就是人体的粗糙外形这叫视觉壳Visual Hull。第二一个被称为点-图像 Transformer一种让照片里的信息和三维点上的信息互相交换笔记的神经网络在这个粗糙外形上精修一次计算直接输出所有棉球的参数——不需要反复调试。逐场景优化和前馈推理差在哪老厨师接到新订单要现场尝味、调配方几十分钟出一道菜而 PointSplat 是尝过十万道菜的厨师看一眼食材就直接报出配方几秒钟出锅。前者的学习发生在接单之后优化后者的学习发生在上岗之前预训练。一、把优化变成推理方法拆解PointSplat 的方法本体是两件武器。第一件武器射线投射Ray Casting做的几何先验。系统先用各视角的人体二值掩码做空间雕刻Space Carving得到粗糙几何代理体素化之后射线投射做两件事剪掉对可见表面毫无贡献的内部冗余点同时建立显式的 2D–3D 对应关系。第二件武器点-图像 Transformer。二维外观 Token 与三维几何 Token 在交替注意力Alternating Attention下交互——全局注意力看整体语境点向注意力保局部结构图像向注意力建模视角内与跨视角关系——最终在单次前向传播里回归出高斯基元的全部属性。官方管线概览论文的核心洞见是以物体为中心、直接在三维空间里做预测而非让每个视角各自编码一遍同一个人。视角中心View-Centric路线把同一份主体信息反复编码 N 次——这是结构性的浪费。项目页这张对比图把这个差别画得很直观左边是每个视角各自投影出高斯的视角中心路线右边是从一个统一点集直接前馈预测高斯的 PointSplat点数大幅减少思想史上还有一层意味论文里写的是前馈预测思想史里写的是另一件事——逐场景优化正在变成预训练推理。训练阶段的梯度下降被搬进网络权重推理时不再求解问题而是认出答案。这与世界模型World Model的逻辑同源。但要克制前馈化不等于接口化一个表示法可以被前馈地预测同时仍然是系统的核心研究对象。二、实验数据怎么读三个指标含义PSNR峰值信噪比渲染图和真图的像素级吻合度单位是分贝越高越好SSIM结构相似度两张图在结构、纹理上像不像0 到 1越高越好LPIPS学习感知图像块相似度用一个模仿人眼感知的人工智能来评判看起来像不像越低越好——对新视角渲染而言这个指标往往最客观。论文的评测方法是8 个 512×512 输入视角在 DNA-Rendering约 1000 段训练序列、16 段评测上训练在 ActorsHQ 上零样本泛化测试指标计算在前景区域内所有方法统一用纯 PyTorch 实现无定制 CUDA 加速因此下面所有推理时间都是保守值。主表数字如下表 1DNA-Rendering 与 ActorsHQ 主对比均为 8 视角 512×512 输入方法DNA-Rendering PSNR/SSIM/LPIPSActorsHQ PSNR/SSIM/LPIPS高斯数单帧推理GS-LRM视角中心18.25 / 0.582 / 0.36416.96 / 0.675 / 0.299204k0.32sAnySplat无位姿20.97 / 0.790 / 0.14319.11 / 0.699 / 0.23886k0.53sGPS-Gaussian视角中心22.35 / 0.797 / 0.17223.81 / 0.887 / 0.08451k×N0.07×N sDepthSplat视角中心23.98 / 0.821 / 0.13122.39 / 0.797 / 0.157212k0.45sLVSM视角中心23.24 / 0.802 / 0.13524.00 / 0.804 / 0.128—1.0×N sPointSplat27.18 / 0.891 / 0.07127.62 / 0.887 / 0.08471k0.40s另外三张表分别回答另外三个问题。表 2THuman2.0 / RenderPeople 合成数据全程指标4 视角下 PointSplat 30.68 PSNR 对 RoGSplat 的 28.948 视角下 34.30 对 GPS-Gaussian 的 31.08且 GPS-Gaussian 的高斯数随视角数线性膨胀、还需要真值深度监督。表 31024×1024 零样本无微调PointSplat 26.54 / 0.882 / 0.123与优化式的 Diffuman4D26.32 / 0.881 / 0.150画质打平但快得多而前馈基线中最好的 GPS-GS 只有 20.63——LVSM 因显存限制在该分辨率下完全无法运行。表 4输入视角数量压力测试4 相机时 PointSplat 23.16 PSNR比最强的 LVSM20.58高 2.6 分贝16 相机时 27.31仍领先次优的 25.35。这组数字该怎么解读六点第一对直播场景紧凑的高斯表示是降低带宽门槛的重要前提。每个高斯要存储位置、尺度、旋转、透明度、颜色等属性7.1 万和 21.2 万的原始数据量差别巨大。PointSplat 将高斯数量压到约三分之一从源头减少了需要被编码和传输的数据量。但这只是第一步——最终能否塞进实时传输带宽还取决于后续的压缩编码效率。工业界的 LiveGS 系统已经证明通过高效的压缩方案自由视角视频直播的码率可以被控制在 20 Mbps 以内实现在移动端的流畅播放。因此PointSplat 的价值在于它提供了一个更干净的输入为后续的高效压缩和传输创造了更有利的条件。第二画质不是更好是跨档领先——但要看清赢的对象。对前馈基线优势是碾压级的PSNR 领先次优方法 3.2 分贝LPIPS 几乎腰斩且三项指标、两个数据集全部第一没有任何一项靠以长补短。对优化式方法则是另一回事1024 分辨率下它与 Diffuman4D 画质打平、与 44 视角稠密输入优化出的 4DGS 视觉保真度相当——但算力成本只有零头。所以准确的定位是前馈赛道内的代差级领先加上对优化路线的成本替代。把它说成画质飞跃或提升有限都不准确它赢的是画质×成本的乘积。第三速度不是它的卖点别误读。0.40 秒的推理时间在前馈组里只排中游GS-LRM 0.32 秒更快AnySplat 0.53 秒更慢。这篇论文的竞争力从来不在单次前向最快而在单位高斯的画质效率——每个高斯携带的信息量远高于基线这才是 7.1 万个高斯打赢 21.2 万个的实质。第四鲁棒性数据比平均分更值钱。4 相机到 16 相机的压力测试里基线的 PSNR 随视角减少雪崩GPS-GS 从 24.75 跌到 13.71PointSplat 从 27.31 缓降到 23.16跌幅最小——这是以物体为中心设计的直接红利信息只编码一次视角多少影响的是观察充分性不是表示本身的冗余度。零样本上 1024 分辨率仍守住了对全部前馈基线的优势PKU-DyMVHumans 多人动态场景的定性结果图 5则说明这套先验不依赖单人假设。对直播这种机位数量今天四个明天六个的真实部署环境这些比基准测试上多零点几个分贝更有实际意义。第五消融实验回答了功劳归谁。两件武器是承重墙去掉射线投射高斯数从 7.1 万涨回 22.4 万——一个模块贡献了约三分之二的紧凑性去掉体素编码数量翻倍、时间翻倍。把 Point-Image Transformer 换成同参数量的全自注意力画质持平27.09 对 27.18但推理时间从 0.4 秒涨到 1.1 秒——交替注意力用 2.75 倍的速度买到同等画质这个设计是被算力预算逼出来的合理选择。而体素大小的扫描表 8揭示了最耐人寻味的一点画质在 0.003~0.005 体素区间已经饱和23.8 万个高斯的配置打不过 18.9 万个。论文选定的 7.1 万工作点是在画质饱和区里挑的性价比最高点——紧凑对它而言几乎免费这才是画质×紧凑双第一的底气。第六成本也要摆上台面。这套能力是用 300k 次迭代、批量 32、在 NVIDIA H20 上训出来的网络本体是 4 块、1024 隐层宽的 Point-Image Transformer每 token 解码 16 个高斯。前馈化的免费只是推理时的错觉——成本被转移到了训练侧和数据侧。这一点对理解第六节的产业走向很重要。三、这条赛道到底有多挤谈论 PointSplat 的位置之前先看它所在的竞技场。2026 年上半年稀疏输入 前馈 人体 高斯这个组合密集出现以下清单是示例性的远未穷举工作时间/出处输入它赢在哪HumanGS2026.04稀疏多视角可驱动约 0.96 秒产出 SMPL-X 对齐的规范空间资产分钟级压缩到秒级动画渲染 60 FPS 且无需逐帧网络推理HumanNOVACVPR 2026 Highlight单张图片输入最狠1 秒内重建静态三维人像LPIPS 相对提升超 40%训练数据扩至 10 万资产GenFusionICLR 2026斯坦福单目视频时序记忆渐进式更新规范空间当前看不到的部位能从过去帧里回忆出来HiReFF2026.064 个无标定视角分辨率与部署2K 流式重建单卡 3.01 FPS训练显存仅增 34%GUSH3R2026.07东京大学单目视频范围单次前馈同时重建动态人体与静态场景PointSplatECCV 2026浙大稀疏多视角画质 紧凑双第一对前馈基线 PSNR 领先 3 分贝以上、LPIPS 接近腰斩而高斯数只有 7.1 万一个更有意思的注脚2026 年 4 月还有另一篇同名论文PointSplatarXiv 2604.09903做的是静态场景的几何剪枝与高斯精修——连名字都撞车了。这个领域拥挤到了什么程度可见一斑。把六行摆在一起赛道的真实结构就浮现了。讨论谁的前馈更快之前得先把快拆开表里的秒级指的是单次前向的建模延迟这几家都在这个量级——一个现成的锚点是 PointSplat 自己0.40 秒的推理时间在前馈组里只排中游GS-LRM 0.32 秒比它快可见单次延迟已经拉不开差距而持续吞吐是另一回事——HiReFF 在 2K 分辨率下是 3.01 FPS折算每帧约 0.33 秒仍属亚秒级可它说明秒级只在给定分辨率下成立分辨率越高吞吐越成为瓶颈。把快这一层剥掉之后真正的差异化才浮出来先验怎么注入、画质与紧凑怎么权衡、时间维度怎么处理。PointSplat 的坐标是画质×紧凑——它是唯一一个在画质绝对值上甩开同代前馈方法、同时把表示压到 7.1 万个高斯的工作HumanGS 押注可驱动性HumanNOVA 把输入压到一张图GenFusion 和 GUSH3R 攻时间维度HiReFF 攻分辨率与部署成本。这条支线的共识是重建正在被前馈化分歧在于各自的先验配方——而这正是第五节要展开的边界问题。四、二十年三代命题一个实验室的来路孤立地看PointSplat 是拥挤赛道里的一篇放回浙大 zju3dv 团队的谱系里看它有清晰的来路。而且这条来路本身就是理解本文主题的最好线索。这条线从先验怎么注入开始。2021 年的Neural Body面临的问题是神经辐射场NeRF本身没有人体概念直接优化一个动态人的隐式场会到处漂移。解法是放一组稀疏锚点Anchors在参数化人体模型SMPL蒙皮多人线性模型表面让隐式场的颜色与密度从这些锚点长出来——人体结构先验第一次被系统性地注入神经渲染。这项工作还顺带产出了一个馈赠ZJU-MoCap 数据集此后几乎整个人体新视角合成领域的评测都跑在它上面。接下来五年先验换了很多件外衣。沿着 Neural Body 开辟的方向一批可驱动神经渲染Animatable Neural Rendering工作把变形场、蒙皮权重、规范空间Canonical Space这些概念逐一打磨成熟期间的每一步都在回答同一个问题的变体先验应该以什么形态存在——显式锚点可学习形变共享规范空间4K4D 把先验搬进了高斯。2024 年的4K4D用 4D 高斯替代隐式场把动态人体渲染推进到 4K 分辨率的实时量级——表示法换代了但人体结构先验打底这条主线没有断。PointSplat 把先验连求解器一起换掉。到了 2026 年PointSplat 的先验不再是某种中间表示而是前馈网络本身视觉壳提供几何起点网络权重里沉淀的是见过上千段人体视频的经验。从锚点到形变场到高斯到权重——先验的形态在二十年里换了四代每一代都比上一代更重直到这一代先验重到把优化过程整个包了进去。一个实验室二十年的积累换来的是一条命题的三次改写——从先验怎么注入到表示怎么变快再到优化怎么被学掉。这不是一篇孤立论文是一个实验室的自然延伸。也因此它的结论不能轻率外推。五、边界论文指出方法可能受制于内存约束而难以扩展到无界场景构建时间一致且紧凑的四维表征仍是开放问题。展开看前馈化成立有两个前提。第一人体是结构化对象开放场景不是。视觉壳需要干净的前景掩码射线剪枝需要物体只占视野一小部分。杂乱的山谷、反光的大厅没有视觉壳可刻。一个佐证GUSH3R 处理开放场景时用的不是视觉壳而是人体-场景基础模型提供的几何先验——场景越开放对基础模型先验的依赖越深。第二时间一致与紧凑是两难问题目前还没有人同时拿到。把话说准确GUSH3R 用记忆 TokenMemory Token部分解决了时间一致性代价是表征远不如 PointSplat 紧凑PointSplat 把紧凑做到了极致代价是还没碰时间维度。两者兼得才是那个真正的开放问题——两者不冲突只是分工不同。论文自己的消融实验已经把这个边界跑成了数字。几何代理的对照实验表 7显示把视觉壳换成 VGGT 深度图——当前最强的现成几何先验——画质直接掉 1.2 分贝换成前景边界框PSNR 崩盘 3.3 分贝、LPIPS 翻倍换成视锥采样再掉一截。论文的结论是一致的几何代理Consistent Geometry Proxy提升质量与鲁棒性——重要的不是先验多强而是同一个三维参考系贯穿所有视角。先验降级一切归零前馈化在人体上成立成立在先验足够强且贯穿所有视角这个前提上。两条边界合起来人体是前馈化最肥沃的土壤这个结论不能被当作前馈化的一般性证明。六、一次前馈推理之后重建变成了什么回到标题的问题。答案其实不在论文里藏在过去半年产业界的三次落子里。第一次落子高斯成了文件格式。2026 年 2 月 3 日科纳斯组织Khronos GroupOpenGL 与 glTF 标准背后的联盟发布高斯泼溅 glTF 扩展 KHR_gaussian_splatting 的候选规范将高斯基元的位置、旋转、尺度、不透明度、球谐系数全部写进三维资产交付格式谷歌、英伟达、苹果等企业背书。九个月后这条规范于 2026 年 9 月初正式获批进入官方扩展注册表。几乎同一节奏OpenUSD 在 3 月 23 日发布的 v26.03 中引入 UsdVolParticleField3DGaussianSplat 架构让高斯成为场景图里的一等公民并附带参考渲染器与 PLY 转换脚本。而压缩类扩展SPZ 2.0 等至今仍在草案或候选状态——标准化推进最快的恰好是表示本身。同期英伟达把重建做成了 Omniverse NuRec一个通过 gRPC 接口远程调用的服务连人工智能体都能编程调用它去生成、检查、精修重建环境。文件格式标准化、能力服务化网格Mesh三十年前走过的正是这条路。当一项技术变成任何人都可以读写的格式它就不再需要亲自出场了。第二次落子重建知识进了权重。视觉几何基础模型VGGT视觉几何 grounded Transformer 那一脉已经证明相机位姿、深度、点云这些原本需要精心求解的中间量可以被一次前馈预测出来。PointSplat 做的其实是同一件事的另一面把怎么求解一个场景变成认出一个场景。当重建的能力以权重的形式沉淀下来它就从一个需要现场执行的流程变成了基础模型的内置功能——调用它和调用一个卷积层没有区别。别忘了第二节的账本这份内置是用数千段人体视频、H20 上 300k 次迭代买来的。能力下沉的方向确定但下沉的成本由谁来付是接下来产业博弈的真正问题。第三次落子生成体系开始回收重建。世界模型需要带相机轨迹、深度、多视角稳定性的训练语料原始互联网视频喂不饱它——于是重建管线反过来被用来筛选、补全、治理训练数据。资本已经给出回应Waymo 这类曾重金投入重建的公司正在把资源从重建转向世界模型。而研究侧的拉锯还在继续——同一个月里GUSH3R 把统一用 3DGS 表示人与场景写进核心贡献世界模型 MoWorld 则把高斯列为五个下游应用之一。谁代表未来取决于生成的一致性何时追平重建的精度这个时间点目前没有人知道。三次落子合起来再叠加第三节赛道的结论可以回答标题了重建这条路线不会死但它的位置正在从台前移到幕后——从需要现场求解的问题变成沉淀在权重里的功能从论文的贡献点变成格式标准和服务接口从目的本身变成教模型认识世界的原料。人体重建这条窄路上竞争对象已经从优化换成了先验这正是 PointSplat 这类工作真实的意义所在。最后留一个开放问题当生成的几何一致性足够好——好到世界模型吐出的内容可以直接反推出可用的显式表示——渲染侧对重建的需求会先消失还是先变成生成体系的内置校验器PointSplat 把重建压缩进一次前馈推理。这个压缩本身不回答问题但它让问题变得更紧迫了。参考链接清单PointSplat 本体论文 arXiv[2606.32036] PointSplat: Compact Gaussian Splatting via Human-Centric Prediction 2026-06-30论文 HTML 全文量化数据来源PointSplat: Compact Gaussian Splatting via Human-Centric Prediction官方项目页PointSplat: Compact Gaussian Splatting via Human-Centric PredictionGitHub 仓库GitHub - zju3dv/PointSplat: [ECCV 2026] PointSplat: Compact Gaussian Splatting via Human-Centric Prediction · GitHubalphaXiv 镜像PointSplat: Compact Gaussian Splatting via Human-Centric Prediction | alphaXiv同期赛道1. HumanGS[2604.10259] Real-Time Human Reconstruction and Animation using Feed-Forward Gaussian Splatting 2026-04-11D. Chatterjee 等仅 1 万帧 THuman2.1 训练、建模提速 15 倍、60 FPS 动画2. HumanNOVACVPR 2026 HighlightUT AustinCVF 官方页 CVPR 2026 Open Access Repository arXiv [2606.02573] HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image GitHub GitHub - HumanNOVA/HumanNOVA: HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image (CVPR 2026 Highlight) · GitHub 项目页 HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image3. GenFusionICLR 2026斯坦福arXiv [2603.28997] GenFusion: Feed-forward Human Performance Capture via Progressive Canonical Space Updates ICLR 正式版 https://proceedings.iclr.cc/paper_files/paper/2026/file/bcb39ab119005a73126935a33b1a8c62-Paper-Conference.pdfOpenReview https://openreview.net/pdf?idHlsFKjrHSw4. GUSH3R东京大学[2607.05243] GUSH3R: Everyone Everywhere All at Once as Gaussians10. HiReFF[2606.29333] HiReFF: High-Resolution Feedforward Human Reconstruction from Uncalibrated Sparse-View Video5. 同名论文[2604.09903] PointSplat: Efficient Geometry-Driven Pruning and Transformer Refinement for 3D Gaussian Splatting浙大谱系1. Neural BodyCVPR 2021Best Paper 候选CVF官方页 CVPR 2021 Open Access Repository 代码 GitHub - zju3dv/neuralbody: Code for Neural Body: Implicit Neural Representations with Structured Latent Codes for Novel View Synthesis of Dynamic Humans CVPR 2021 best paper candidate · GitHub2. 4K4DCVPR 2024https://openaccess.thecvf.com/content/CVPR2024/html/Peng_4K4D_Real-Time_4D_View_Synthesis_at_4K_Resolution_CVPR_2024_paper.html工程标准化与产业1. Khronos 官方新闻页2026-02-03 候选规范公告原文The Khronos Group2. KHR_gaussian_splatting 规范仓库glTF/extensions/2.0/Khronos/KHR_gaussian_splatting at main · KhronosGroup/glTF · GitHub3. OpenUSD v26.03AOUSD2026-03原生高斯 SchemaThe Alliance for OpenUSD (AOUSD)4. NVIDIA Omniverse NuRec 官方文档gRPC 服务NVIDIA Omniverse NuRec — NVIDIA Omniverse NuRec5. Waymo 世界模型Genie 3 后训练比原引用强的权威源——Ars Technicahttps://arstechnica.com/google/2026/02/waymo-leverages-genie-3-to-create-a-world-model-for-self-driving-cars/其他1.VGGT[2503.11651] VGGT: Visual Geometry Grounded Transformer2. 原始 3DGS3D Gaussian Splatting for Real-Time Radiance Field Rendering
返回列表