
V4.0 交换机卷范围与基线约定V4.0.1 适用场景拓扑:Rail‑optimized Leaf‑Spine;每 GPU 一卡 400G,同 rail 同 TP group 优先 leaf‑local,跨 rail/跨 SU 才走 spine。业务:vLLM 张量并行 All‑Reduce/All‑Gather/Reduce‑Scatter、NCCL over RoCEv2(UDP/4791)。目标:零 RDMA 丢包;稳态靠 ECN/DCQCN 降速,PFC 仅作微突发/极端拥塞兜底;CNP 低时延优先转发。V4.0.2 全网信令基线(任一一跳不一致都会降级)流量DSCP交换机优先级/TCPFCECN/WRED调度vLLM/NCCL RoCE 数据26(AF31,常用)或 24(CS3,Cisco AI CVD 用)3开开RoCE 队