
1. 新旧策略比值rt(θ)r_t(\theta)rt(θ)rt(θ)πθ(at∣st)πθold(at∣st)r_t(\theta) \frac{\pi_\theta(a_t\vert{}s_t)}{\pi_{\theta_{old}}(a_t\vert{}s_t)}rt(θ)πθold(at∣st)πθ(at∣st)物理含义本质衡量策略更新幅度的比值 (Ratio)。分子πθ\pi_\thetaπθ当前正在训练的新策略采取动作ata_tat的概率。分母πθold\pi_{\theta_{old}}πθold收集数据时冻结的旧策略采取动作ata_tat的概率。工程作用 (Why it matters)防止策略崩溃rtr_trt越偏离 1说明新策略相比旧策略跑得越偏。PPO 通过计算这个简单的比值配合clip函数通常限制在[0.8, 1.2]之间以极低的计算成本替代了复杂的 KL 散度计算从而强制限制网络更新的步伐保证训练极其稳定。动态表现遇到好动作Advantage 0网络会推高rtr_trt遇到坏动作Advantage 0网络会压低rtr_trt。2. Entropy-loss“有点像图像分类损失中的正则化项”