
PPO 会探索、CBF 会保命RADAR-BPO 把复杂环境碰撞率压到 10.7%原文Risk-Aware Reinforcement Learning with Dynamic Safety Filter for Collision Risk Mitigation in Mobile Robot Navigation作者Bingbing Guo、Guina Wang、Yiyang Chen、Yue Gao苏州大学机电工程学院、Qian Xie江苏易程科技股份有限公司期刊Sensors 2025, 25, 5488MDPI2025-09-03 出版DOI: 10.3390/s25175488图注左上 Actor / 左下 Critic 是标准的 PPO 结构右侧才是本文的关键增量策略输出的速度指令(v,ω)(v,\omega)(v,ω)不直接下发而是先经过 CBF-QP 模块做一次安全审查——在满足控制屏障函数约束的前提下找到离原动作最近的可行动作。整条链路就是探索交给 PPO、安全交给 QP。强化学习会给机器人敢冲的探索精神但不会给你任何不撞的承诺。这篇 Sensors 论文的思路非常直接在 PPO 的动作和执行之间插一个基于控制屏障函数CBF的安全阀用二次规划QP实时把危险动作改造成安全动作。结果是在最复杂的混合障碍环境里碰撞率从 PPO 的 30.67% 降到 10.67%任务成功率接近 90%。研究背景与现有方法不足移动机器人在动态环境里躲避碰撞是刚需但传统方法存在结构性矛盾基于规则的传统导航依赖预定义规则避障半径、优先级、状态机等在复杂动态环境里难以做到灵活、安全、实时三者兼顾——规则写死了就不灵活规则放宽了就不安全。纯强化学习PPO/DQN/DDPG 等探索效率低、策略波动大、安全性没有保证。论文用实验数据把这一点量化了在最复杂的混合环境Env 3中PPO 的碰撞率高达30.67%更值得注意的是环境切换时的崩溃现象——从多静态障碍环境切到混合环境后PPO 策略几乎失效需要从极高碰撞率开始重新爬升学习过程剧烈震荡。单独使用 CBF能给出形式化的安全保证但 CBF 本身只是一个约束层不具备要去哪儿、怎么走更高效的决策能力。作者的判断是会探索和不撞应该由两个不同的模块分别负责而不是指望一个端到端策略同时具备。于是问题变成如何在保留 PPO 探索能力的同时把安全性从策略里拆出来做成一层的实时滤波核心创新点1RADAR-BPO把 PPO 与 CBF 做深度集成。命名拆开就是这套方法的全部内容——Risk-Aware、Dynamic、AdaptiveRegulationBarrierPolicyOptimization。它在每个训练迭代中先用当前策略πθ\pi_\thetaπθ与环境交互收集轨迹探索用 PPO GAE 更新策略与价值网络学习然后在动作下发前做一次安全滤波CBF最后才把安全动作交给机器人。2CBF-QP 安全滤波器用最小改动实现安全。每步求解一个二次规划minv,ω ∥a−atPPO∥2s.t. 2v⋅(Δp⋅i) ≥ −α(∥Δp∥2−rsafe2), 0≤v≤vmax, ∣ω∣≤ωmax\min_{v,\omega}\ \|a - a^{PPO}_t\|^2 \quad \text{s.t.}\ 2v\cdot(\Delta p\cdot i)\ \ge\ -\alpha(\|\Delta p\|^2 - r_{safe}^2),\ 0\le v\le v_{max},\ |\omega|\le \omega_{max}v,ωmin∥a−atPPO∥2s.t.2v⋅(Δp⋅i)≥−α(∥Δp∥2−rsafe2),0≤v≤vmax,∣ω∣≤ωmax其中Δp\Delta pΔp是机器人相对最近障碍的位置向量rsafer_{safe}rsafe是安全距离。这个形式的含义很工程化在保证离障碍足够远的前提下尽量别改变 PPO 原本想做的事。因此它既能拦住危险动作又不会让策略失去学习方向——论文强调这种设计让策略改进与安全保障互相强化。3风险感知的自适应多目标奖励。奖励由四项相加项形式作用方向奖励rhr_hrh1cos(θdiff)1\cos(\theta_{diff})1cos(θdiff)朝向目标方向取值 [0,2]距离奖励rdr_drd5exp(−2dt/d0)5\exp(-2 d_t/d_0)5exp(−2dt/d0)鼓励向目标推进障碍惩罚robr_{ob}robrriskr_{risk}rrisk当dminrsafed_{min} r_{safe}dminrsafe否则rnormalr_{normal}rnormal把离得太近直接变成负反馈速度奖励rvr_vrvexp(−(vt−vdes)2/2σ2)\exp(-(v_t-v_{des})^2/2\sigma^2)exp(−(vt−vdes)2/2σ2)vdes0.25min(1.0,dt)v_{des}0.25\min(1.0,d_t)vdes0.25min(1.0,dt)σ0.1\sigma0.1σ0.1远时快、近时慢兼顾效率与精度四项设计成量级相当并直接相加作者明确说这是为了简单、可解释、少调参。4三阶段课程式训练。环境按复杂度递增动态行人环境150 回合→ 多静态障碍200 回合→ 静态动态混合的复杂环境300 回合。训练回合在到达目标 / 碰撞 / 达到最大步数时结束。这一设计让 agent 先夯实基础避障能力再挑战难环境——也正是环境切换后仍能稳定微调的基础。图注这张图展示的是安全滤波器在真实运行中的效果机器人依次穿过动态行人与障碍蓝色射线为激光扇区路径平滑没有贴脸的瞬间。它的意义在于证明 CBF 不是纸面约束而是在每一步都在改变控制量的活机制。图注理解 CBF 最省力的图集合 D 是安全区内部 Int(D) 是随便走边界 ∂D 就是 CBF 约束起作用的地方——一旦靠近边界QP 就会开始修正动作把机器人推回安全区内。实验平台仿真环境全部实验在ROS Gazebo平台完成机器人为麦克纳姆轮全向移动底盘论文给出四轮速度与vx,vy,ωv_x, v_y, \omegavx,vy,ω的完整运动学关系车体半长Wa0.195W_a0.195Wa0.195m、半宽Wb0.172W_b0.172Wb0.172m、特征长度dWaWb0.367dW_aW_b0.367dWaWb0.367m。感知与安全参数2D 激光雷达角度范围[0°, 360°]扫描距离[0.08, 10] m安全距离rsafe0.5r_{safe}0.5rsafe0.5m屏障参数α1.0\alpha1.0α1.0最大线速度 0.5 m/s、最大角速度 1.0 rad/s。三个测试环境递进式Env 1动态行人环境——两个行人以固定速度往返论文用 Table 1 给出了具体轨迹坐标另有两个静止行人机器人从 (0.0, 0.0) 出发前往 (3.0, 3.0)。Env 2多静态障碍环境——多个圆柱/立方障碍。Env 3复杂混合环境——多个行人与多种静态障碍共存。训练超参折扣因子 γ0.99、GAE 参数 λ0.95、裁剪阈值 ε0.15、价值系数c1c_1c10.5、熵系数c2c_2c20.01策略迭代次数 K 按环境取 [150, 200, 300]。对比基线PPO、DQN、DDPG评估指标为成功次数、碰撞次数、平均奖励、碰撞率同一环境下各跑完整训练回合Env 1 共 150、Env 2 共 200、Env 3 共 300 回合。主要结果与 PPO 的核心对比Table 3环境指标PPORADAR-BPOEnv 1动态行人成功 / 碰撞次数27 / 12347 / 103碰撞率82.00%68.67%Env 2多静态障碍成功 / 碰撞次数134 / 66164 / 36碰撞率33.00%18.00%平均奖励377.011070.09约 2.8 倍Env 3复杂混合成功 / 碰撞次数208 / 92268 / 32碰撞率30.67%10.67%约为原来的 1/3平均奖励399.38762.66任务成功率Env 3 中 RADAR-BPO 在 300 个回合里成功268次≈89.3%即摘要中接近 90%的避障成功率PPO 为 208 次Env 2 中为 164/20082%对 PPO 的 134/200。碰撞率Env 3 从 30.67% 降到 10.67%降幅约 2/3Env 2 从 33.00% 降到 18.00%。其他基线全面落后Env 2 中 DDPG 平均奖励仅 58.02、碰撞率 87.50%Env 1 中 DQN 碰撞率 100.00%150 回合全撞DDPG 88.67%——说明在动态避障任务上朴素的价值/策略方法很难稳定工作。训练稳定性Figure 8 的奖励曲线Env 2 阶段RADAR-BPO 的奖励迅速突破 1000 并稳定在约 1100而 PPO 缓慢爬到约 400DQN/DDPG 明显更差Env 3 阶段所有算法都因难度上升而性能回落但 RADAR-BPO 依然稳定在约 760曲线平滑抗震荡PPO 则在 400 以下剧烈波动论文对此的解释很关键环境切换后 PPO 需要从极高的碰撞率重新痛苦学习而 RADAR-BPO 依靠 CBF 提供的实时安全保证保留了核心避障能力之后的调整只是在高性能基线上的稳定微调。换句话说它牺牲了看起来更陡的学习幅度换来了更高、更稳、更安全的最终性能。图注从左到右是 Env 1两个往返行人 两个静止行人、Env 2多静态障碍、Env 3静态与动态障碍共存的混合环境蓝色射线是激光扇区可视化。三阶段的复杂度递增就是本文课程式训练的物理对应物。图注虚线标出三次环境切换的位置。最值得看的是每次切换瞬间PPO蓝虚线在 Env 2→Env 3 处出现明显震荡与下滑而 RADAR-BPO橙实线平稳过渡——这就是实时安全滤波保留住核心避障能力的直接证据。图注九宫格展示了机器人如何在多行人、多障碍的混合环境里逐步穿过——每一帧都标出激光扇区蓝色与机器人、行人位置。这张图是过程安全最有说服力的可视化。对机器人工程实践的启示把安全从策略里拆出来是 sim-to-real 最省事的工程手段。端到端策略要论证不撞几乎没有办法而策略 显式安全滤波层可以让安全约束独立于网络权重即使策略在新环境里退化滤波层仍能兜住底线Env 3 的碰撞率降幅就是证据。安全滤波的成本要算进控制周期。每一步都要解一个 QP含 360° 激光带来的多个障碍约束因此工程部署时要评估最坏情况求解时间与降采样策略——这与最坏耗时决定控制回路的经验一致。环境切换的稳定性比峰值性能更重要。产线/仓库的场景是不断变化的PPO 式换环境就崩、重新学的行为代价极高RADAR-BPO 奖励曲线的平滑过渡提醒我们在线运行中策略退化的速度比它的最优性能更值得关注。奖励函数不必复杂量级对齐即可。四项相加方向、距离、障碍、速度且刻意设计成量级相当作者明确说是为了可解释、少调参这套写法可以直接借用。课程式训练是低成本的泛化手段。150 → 200 → 300 回合的渐进训练安排回合数随环境复杂度增加几乎不需要额外工程投入却显著改善了难环境下的表现。主要局限 未来方向只有 Gazebo 仿真没有真机实验。论文的结论近 90% 成功率、10.67% 碰撞率全部来自 ROS Gazebo真实底盘的打滑、定位漂移、行人真实行为都未验证。人群行为过于理想化。行人的运动轨迹是预先设定好的折返运动论文 Table 1 直接给出坐标不含随机性也没有社会规范如靠右通行、个人空间建模——这与真实人群差距很大。安全模型的表达能力有限。CBF 采用静态屏障参数α1.0\alpha1.0α1.0与到最近障碍点的几何约束属于瞬时几何安全不含速度障碍/轨迹预测对于高速接近的障碍几何上当前够远并不代表下一秒安全。评估口径单一。每格只有一轮完整训练150/200/300 回合的统计没有多随机种子重复实验也没有对 CBF 开关、rsafer_{safe}rsafe、α 等关键参数的敏感性分析。未来方向向真实平台迁移、引入行人轨迹/意图预测与更动态的屏障函数时间变化的 α、多机器人协同与更多随机种子的统计验证。总结RADAR-BPO 的贡献可以用一句话概括它把探索和保命这两件事拆给了两个模块——PPO 负责在环境里大胆试错并学习导航策略CBF 负责在每一个控制周期用一次二次规划把危险动作拉回安全边界内。效果很直接在最复杂的混合障碍环境中碰撞率从 30.67% 降到 10.67%约降 2/3平均奖励从 399.38 提到 762.66任务成功率接近 90%在环境切换时PPO 会出现从高碰撞率重新学习的崩溃式震荡而 RADAR-BPO 能平稳过渡。对做移动机器人导航的团队来说这篇论文给出的最具迁移价值的经验是不要把安全性寄托在网络权重上把它写成一个可以在线求解的约束层。