FERPO:前向熵正则化策略优化

FERPO: Forward Entropy-Regularized Policy Optimization

arXiv: 2610.02198v1

论文信息

标题: FERPO: Forward Entropy-Regularized Policy Optimization

作者: Sebastian Sanokowski, Alireza Sarmadi, Majid Khadiv

发布日期: 2026-10-01

arXiv ID: 2610.02198v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决 on-policy 连续控制中 critic 值预测准确但动作梯度不准确、可能误导策略更新的问题。
  • 核心方法:FERPO 从熵和 KL 正则化的策略改进目标中构造显式目标动作分布,用前向 KL 拟合策略,并用自归一化重要性采样(SNIS)估计,不计算 ∇aQϕ\nabla_a Q_\phi。
  • 关键结果:在 DMC 上 FERPO 最终 IQM 为 897.7±6.7897.7\pm6.7,略高于 REPPO 的 891.0±6.4891.0\pm6.4;在 DMC 与 ManiSkill 上以更少环境交互达到较高性能(图 4,第 5.4 节)。
  • 主要局限:作者承认 critic 值误差、有限样本重要性采样误差、受限高斯策略和更高 GPU 内存使用;在 G1/T1 聚合上 FERPO 最终 IQM 低于 REPPO(第 6 节,表 4)。
  • 适合读者:强化学习研究者、机器人学习工程师,以及对最大熵 RL、策略分布匹配和 on-policy 算法感兴趣的读者。

论文背景和研究动机

大规模并行仿真使 on-policy 强化学习在机器人运动和操作中变得高效,也促使研究者重新审视 actor 更新的可靠性。REPPO 等方法通过学到的 soft action-value critic 计算动作梯度来更新策略。但 critic 通常被训练为准确预测价值,价值预测准确并不自动意味着动作导数准确。论文指出,critic 梯度误差可能使策略改进产生偏差;在 on-policy 学习中,数据分布不断变化,这种偏差可能进一步影响稳定性。这正是 FERPO 的核心动机:是否能够只使用 critic 的值 Qϕ(s,a)Q_\phi(s,a),而不使用其动作导数,从而避开这个不可靠来源。

另一个动机来自分布拟合方向。论文提出,反向 KL 投影容易只覆盖目标分布的少数模式,而前向 KL 更鼓励覆盖多个高价值模式,有利于探索。因此,如果将熵和 KL 正则化的改进目标显式化,再通过前向 KL 拟合参数策略,就有可能在利用 critic 值的同时获得探索性更好的更新。

核心方法和技术细节

FERPO 首先在固定的 rollout 策略 πroll\pi_{\mathrm{roll}} 和 critic QrollQ_{\mathrm{roll}} 下,最小化带熵和 KL 约束的无限制条件分布上的拉格朗日。引入温度 τ\tau 和信任区域系数 λ\lambda,得到最优目标分布:

q∗(a∣s)=1Z∗(s)exp⁡ ⁣(Qroll(s,a)τ+λ)πroll(a∣s)λ/(τ+λ)q^*(a\mid s)=\frac{1}{Z_*(s)}\exp\!\left(\frac{Q_{\mathrm{roll}}(s,a)}{\tau+\lambda}\right)\pi_{\mathrm{roll}}(a\mid s)^{\lambda/(\tau+\lambda)}

这里 λ\lambda 越大,目标越靠近 rollout 策略;τ\tau 控制价值的温度缩放。该分布来自第 3.1 节和附录 B.2。论文在附录 B.4 中形式化证明:对固定 critic 和温度,若每一步都精确拟合目标并刷新参考策略,则迭代最终收敛到 Boltzmann 分布 pQ,τ∝exp⁡(Q/τ)p_{Q,\tau}\propto\exp(Q/\tau),且 λ\lambda 只影响收敛速度而非极限。

FERPO 使用前向 KL 而非反向 KL 将参数策略拟合到 q∗q^*。实际中,从 rollout 策略采样 KK 个候选动作 ai∼πroll(⋅∣s)a_i\sim\pi_{\mathrm{roll}}(\cdot\mid s),用 critic 值计算权重,并采用自归一化重要性采样:

L^F(θ)=−1∣B∣∑s∈B∑i=1Kwi(s)log⁡πθ(ai(s)∣s),\widehat{\mathcal{L}}_F(\theta)=-\frac{1}{|\mathcal{B}|}\sum_{s\in\mathcal{B}}\sum_{i=1}^{K}w_i(s)\log\pi_\theta(a_i(s)\mid s),

其中 wi(s)=softmax⁡i ⁣(Qϕ(s,ai)−τlog⁡πroll(ai∣s)τ+λ)w_i(s)=\operatorname{softmax}_i\!\left(\frac{Q_\phi(s,a_i)-\tau\log\pi_{\mathrm{roll}}(a_i\mid s)}{\tau+\lambda}\right),且权重在 actor 更新时被 stop-gradient 固定。这一步只对策略对数概率微分,不对 critic 反向传播。

温度和 λ\lambda 都被作为拉格朗日乘子自适应更新。温度更新沿用 SAC 的自动熵调:用 fresh 动作估计熵,最小化 τ⋅stopgrad⁡[H^θ−Htarget]\tau\cdot\operatorname{stopgrad}[\hat{\mathcal{H}}_\theta-\mathcal{H}_{\mathrm{target}}]。λ\lambda 更新基于归一化有效样本量 ESS:对每个状态计算 e^(s)=1/(K∑iwi(s)2)\widehat e(s)=1/(K\sum_i w_i(s)^2),最小化 λ⋅stopgrad⁡[Eslog⁡e^(s)−log⁡etarget]\lambda\cdot\operatorname{stopgrad}[\mathbb E_s\log\widehat e(s)-\log e_{\mathrm{target}}]。论文在附录 B.3 的 Proposition 1 中证明,对固定目标,若前向 KL 拟合损失不增加,则 ESS 的下界可转化为策略间 TV 距离的上界,从而把 ESS 控制与信任区域目标联系起来。

critic 训练沿用 REPPO 的设置:多步 TD、HL-Gauss 分类回归,以及辅助自预测损失;未来熵贡献被包含在 soft-return 中。

创新点和贡献

FERPO 的主要贡献是提供了一种不依赖 critic 动作梯度的 on-policy 最大熵策略改进方式。与 REPPO 相比,其 actor 更新只用 Qϕ(s,ai)Q_\phi(s,a_i) 的标量输出对采样动作加权,避免了 “价值准确但导数不准确” 的潜在风险。第二,显式熵 + KL 正则目标与前向 KL 拟合结合,鼓励覆盖多个高价值模式。第三,用归一化 ESS 的 log 形式调节 λ\lambda,直接控制重要性权重集中度,而不是直接约束策略间平均 KL。此外,论文评估了 cached actor updates 和基于 one-step simulation 的 state-value 扩展,以降低重复候选动作评估成本,并在稀疏奖励环境下更直接地利用即时奖励。

实验结果分析

在双峰成本 toy experiment 中,论文展示 FERPO 的目标加权平均会改变更新方向。在参考策略位于两个模态之间时,REPPO 基于当前策略平均成本导数向左移动,FERPO 则向右移动,指向更好的右侧模态(图 1,第 5.1 节)。这说明前向 KL 目标能够对远处高价值区域赋予权重。但论文也报告,直接用 rollout 策略采样时,K=1024K=1024 下只有 26.4% 的批次能恢复正确方向;把采样 proposal 宽度从 σ\sigma 增至 2σ2\sigma、3σ3\sigma 后,恢复率分别达到 98.9% 和 99.9%(附录 A.1,表 1)。这在该 toy 设置中说明候选动作覆盖对重要性采样估计至关重要。

计算基准上,FERPO 在 K=16K=16 时,uncached 版本的总 actor+critic 更新时间比 REPPO 低 6.9%;cached 版本相对 REPPO 的 actor 更新可合并为约 22.2% 的速度提升(第 5.2 节)。代价是 GPU 内存峰值更高:uncached 高 22.4%,cached 高 25.6%(第 5.2 节/附录 A.2)。

消融实验中,在 G1 flat 任务上,KK 从 8 增到 16 使 50.07M 步平均回报从 34.32±0.1834.32\pm0.18 增至 34.81±0.2434.81\pm0.24,但收益递减;将温度设为 0 时,平均回报降至 30.32±0.2730.32\pm0.27,低于自适应温度设置,说明在该任务中最大熵正则化带来更高回报(图 3 左,第 5.3 节)。cached Q 在 G1 flat 上与 uncached 相比最终回报略低:33.58 vs 34.03,但训练时间从 68.4 分钟降至 55.7 分钟,节省 18.6%(图 3 中,第 5.3 节)。在 AcrobotSwingupSparse 上,cached V 扩展的最终回报为 324.79±75.28324.79\pm75.28,远高于 uncached Q 的 99.46±110.7599.46\pm110.75(图 3 右,第 5.3 节/附录 A.3.4);但该扩展使用 17 倍的仿真器 transitions,不能直接用相同交互预算比较。

在 benchmark 汇总上,DMC 的 IQM 为:FERPO 897.7±6.7897.7\pm6.7、REPPO 891.0±6.4891.0\pm6.4、FastTD3 890.6±12.8890.6\pm12.8、PPO(Brax)542.8±30.2542.8\pm30.2、PPO 309.8±9.4309.8\pm9.4;ManiSkill 成功率 IQM 为:FERPO 95.67%、REPPO 95.52%、PPO 84.61%(图 4,第 5.4 节)。在 G1/T1 聚合上,FERPO 为 33.22±0.2833.22\pm0.28,低于 REPPO 的 34.63±0.1734.63\pm0.17;配对 bootstrap 差异为 −1.41-1.41,调整后区间为 [−1.94,−0.94][-1.94,-0.94],因此在该实验设置和最终共同交互预算下,REPPO 在 G1/T1 上占优(表 4)。所以 FERPO 的优势主要集中在 DMC 和 ManiSkill 的样本效率与墙钟效率,而不是所有基准套件上的全局一致性优势。

实践建议

对于连续控制机器人学习场景,FERPO 的一个实际用途是:当团队已经使用 REPPO 或类似的 on-policy 路径梯度方法、但怀疑 critic 梯度估计不可靠时,可以试验将 actor 更新替换为 FERPO 的 critic-value 加权前向 KL 拟合。若延迟是关键指标,优先使用 cached FERPO;但需注意论文报告在 CheetahRun 上 cached FERPO 的 GPU 内存峰值比 REPPO 高 25.6%(第 5.2 节),且在 G1 flat 设置下 cached 终端回报略低于 uncached(图 3 中,第 5.3 节)。因此建议先在小规模任务上比较 cached 和 uncached 的终端表现,再决定是否固定缓存调度。

对于稀疏奖励任务,尤其是即时奖励形状对动作选择重要时,可以考虑论文的 state-value 扩展;但必须评估额外的 K+1K+1 倍模拟器转移是否可接受。作者提供的 Warp 实现只在 AcrobotSwingupSparse 上测得每次迭代约 8.4% 的额外时间(附录 A.3.4)。在动作维度大或奖励表面复杂时,建议先对 KK 和 ESS target 做消融:作者在 G1 flat 上观察到 K=16K=16 优于 K=8K=8,但收益递减;G1/T1 基准使用 ESS target 0.65(第 5.3 节、第 5.4 节)。最后,FERPO 尚未在离散动作空间上实验,作者将其列为未来工作,因此离散控制任务需另行验证。实现代码已公开于 GitHub。