
“大模型推理服务网络性能调优”的可落地手册框架+核心参数+排障清单。若按本大纲逐章扩写(含实验数据、配置文件、故障案例、压测报告模板)0. 调优目标与指标基线大模型推理的网络调优不是“把带宽跑满”,而是让首字快、出字稳、扩缩不抖、跨节点不超时。建议先定 SLO:TTFT(Time To First Token):短 prompt 流式对话 P99<300–800ms,长文档/代码场景可放宽到 1–3s。TPOT/ITL(Inter‑Token Latency):普通对话 P99<30–50ms/token;低延迟 Agent 可目标<20ms。吞吐:token/s/GPU、token/s/节点、请求 QPS 分开看;多节点别只看单请求延迟。网络 SLO:跨节点 NCCL 集合无超时;RDMA PFC pause、ECN mark、丢包、重传接近 0;网关连接复用率>90%、TLS 握手占比<5%。资源联动:GPU 利用率、KV Cache 使用率、等待队列长度、网卡 PPS/BPS、软中断、TCP/UDP 重传要同屏监控。经验:先测“网络纯转发”基线(iperf3/perftest/ib_send_lat),再测“单卡推理”,再测“多卡单节点”,最后测“多节点 TP/PP/EP”。任一层不达标就别往下加规模。