
摘要很多团队把训练集群与推理集群物理分开结果是两边都有闲置白天推理吃紧、训练排队夜里反过来。本文拆解训推一体的三种共享层级物理共享、显存共享、时间片共享、调度优先级与抢占设计、以及切换成本的真实账。2026 奇点智能技术大会11 月 20-21 日 · 北京万达文华酒店的 AI Infra 与后训练专题会讨论这类资源治理问题。一、分开部署的隐性成本训练集群与推理集群分开账面上只有硬件成本实际还有三项隐性成本。峰值冗余。两个集群各自按各自的峰值配置总容量远大于真实峰值之和。资源错配。训练的空闲与推理的繁忙在时间上常常互补隔离部署让这种互补无法发生。运维分裂。镜像、驱动、监控、调度各一套人力成本翻倍。二、三种共享层级层级共享对象收益主要代价物理共享机器、网络、存储运维统一、硬件利用率提升故障域扩大显存共享权重、KV Cache、激活单卡承载更多任务隔离复杂度上升时间片共享算力时段峰值互补抢占导致任务中断实践中三者是叠加的物理共享是基础显存共享决定上限时间片共享决定灵活性。多数团队应该从物理共享起步而不是一上来就做时间片抢占——后者对任务可中断性的要求很高。三、显存复用的三个对象显存占用 权重 KV Cache 激活 框架开销 │ │ │ 推理可共享 推理可共享 训练独有权重同一基础模型的训练副本与推理副本可以共享只读权重节省的基础模型部分相当可观。KV Cache推理侧占用随并发与上下文长度增长是可压缩、可下沉、可分层的部分也是训推共享里最有价值的部分。激活训练独有通常无法与推理共享这部分决定了分离部署的下限。结论很直接共享收益主要来自权重与 KV Cache而不是全部显存。期望值定得过高会导致方案难以落地。四、调度优先级怎么设优先级在线推理 交互式训练 批量训练 抢占策略 在线推理高水位 → 抢占批量训练 批量训练被抢占 → 检查点落盘后让出 交互式训练 → 只允许被在线推理抢占关键是每种任务都必须有可中断点。训练任务需要能在任意步数落盘检查点推理任务需要能在毫秒级让出。不具备可中断性的任务不应放进共享池。五、切换成本的真实账训推一体不是把两类任务混在一起跑就完事切换本身也有成本。上下文切换同一张卡在训练与推理之间切换需要重新加载权重、重建显存池单次开销以秒计。精度与配置差异训练常用高精度与特殊并行策略推理常用低精度与批处理切换需要重新配置。缓存失效切换会清空 KV Cache重新预热需要时间。因此切换频率越低越好。可行的做法是按小时级时段划分主体用途只在边界处切换而不是请求级动态切换。六、先量三件事两边的日利用率曲线确认是否真的互补这是共享的前提。任务可中断比例可中断比例低于一半时时间片共享收益有限。单次切换开销切换开销乘以切换频率就是共享需要跨过的门槛。三项数据都支持时再动手比先建平台再找场景要稳。七、几个常被问到的问题问训推一体适合多大规模的集群答规模越大收益越明显但小集群也不是不能做。判断依据不是卡的数量而是两类任务的利用率曲线是否互补——单机同时跑小推理与小训练同样可以受益。问共享会不会影响推理的稳定性答会前提是没有隔离与优先级。只要做到显存配额、优先级抢占、故障域可控推理的稳定性主要取决于自身实现而不是共享与否。问训练任务被抢占后怎么处理答落盘检查点后释放资源恢复时从最近检查点继续。这要求训练框架支持细粒度检查点否则被抢占的代价会高到不能接受。问共享池的故障域会不会太大答需要通过分组控制。把共享池切成若干故障域单个域内共享资源跨域只共享调度这样单点故障不会扩散到整个集群。问怎么衡量共享是否成功答看两个数字整体有效算力利用率以及关键服务的延迟是否保持稳定。只盯着利用率而忽略延迟容易用牺牲体验的方式刷高数字。八、镜像与驱动必须统一共享池最容易踩的坑是训练与推理使用不同版本的运行时。表面能跑实际会遇到算子实现差异导致的结果不一致排查成本极高。可行做法是把运行时版本作为共享池的准入条件同一池内所有任务使用同一镜像基线需要不同版本时划分到不同池。这条规则会牺牲一点灵活性但换来的是可预期的行为。九、检查点与恢复目标时间片共享要求任务可中断而可中断的前提是检查点足够便宜。需要明确两个数字检查点间隔与恢复时间目标。检查点间隔决定了被抢占时的最大丢失工作量恢复时间目标决定了任务能多快回到运行状态。两者共同决定共享的经济性——如果恢复时间比剩余计算量还长任务就不该被抢占而应该等它跑完。十、存储与网络也要分摊共享池的收益常被按算力计算实际还要看存储与网络。训练任务对存储带宽的需求远高于推理推理任务对网络延迟更敏感。规划时应把存储带宽与网络带宽也纳入配额按任务类型分配 IOPS 与带宽上限避免某一类任务把共享资源打满。算力够用而 IO 打满是共享池里最典型的性能塌陷方式。十一、怎么证明共享没有变慢验证要拿数据说话分别记录共享前后的关键服务 P99 延迟、训练任务的平均等待时间、以及整体有效利用率。三项都改善说明共享有效利用率提升但延迟恶化说明隔离不足两者都没有明显变化说明两类任务的曲线本来就不互补共享的收益被高估了。十二、共享池的准入条件不是所有任务都适合进共享池。准入条件建议包含三项任务可中断、资源需求可预测、以及对延迟的敏感度可控。可中断保证抢占可行资源需求可预测保证调度不会因某个任务异常占用而失衡延迟敏感度可控保证被抢占的任务可以接受等待。三项里有一项不满足就应该放到专用池而不是强行共享。十三、抢占的公平性长期运行的共享池容易出现饥饿高优先级任务持续抢占低优先级任务永远排不上。缓解手段包括给低优先级任务保留一段不可抢占的时间窗、记录被抢占次数并在调度时优先补偿、以及设置最长等待上限触发强制调度。公平性不是体验问题而是容量规划的一部分。一个总是被抢占的队列在规划上等同于不存在。十四、资源计量与结算共享池需要能回答这个任务花了多少资源。计量粒度对齐到任务级即可不必精确到算子。计量结果有两个用途对内做成本归因对外做配额约束。计量口径要固定且可复算否则不同团队对同一任务的成本会有不同理解协作成本会上升。十五、迁移成本不能低估从分离部署迁移到共享池需要改的不只是调度配置还包括镜像基线、检查点机制、监控口径与告警阈值。迁移期间两套体系并存是运维压力最大的阶段。建议把迁移拆成物理共享、显存共享、时间片共享三步每步之间留出稳定期。一次性完成三步的迁移往往在第三步卡住并被迫回滚。十六、再答几个问题问共享池会不会让故障排查变难答会但可以用归属信息缓解。每个任务在共享池中保留明确的归属与资源轨迹出问题时先按归属定位到任务再按轨迹定位到资源。没有这两项信息时共享池确实会把排查变成猜测。问要不要一开始就做显存共享答建议先做物理共享。物理共享只涉及调度与运维统一改动可控显存共享需要处理隔离、碎片与生命周期问题复杂度高一个量级。分步推进能让每一步的收益都可验证。问共享池的收益怎么向上汇报答用三个数字整体有效算力利用率、关键服务延迟分位、以及单位任务的平均等待时间。只讲利用率容易被质疑牺牲了稳定性三个数字一起看更能说明问题。十七、补充说明问共享池需要专用调度器吗答小规模不需要。先用现有调度器配合配额与优先级即可跑通规模上来后再考虑专用调度。过早引入专用组件会让迁移成本上升而收益在早期并不明显。十八、衔接大会专题11 月 20-21 日北京万达文华酒店2026 奇点智能技术大会的 AI Infra 专题会讨论训推一体、资源池化与后训练基础设施C 及系统软件技术大会则从内存管理、调度与性能工程角度给出更底层的实现方法。带着我们训练集群的夜间利用率是多少这个问题去参会比听任何平台架构都更接近真实答案。大会信息2026 奇点智能技术大会 C 及系统软件技术大会时间2026 年 11 月 20-21 日地点中国·北京万达文华酒店大会报名点击报名领取大会PPT资料立即报名锁定 Lukasz Kaiser Keynote 与 70 场演讲完整资料