FERPO:前向熵正则化策略优化
FERPO: Forward Entropy-Regularized Policy Optimization
论文信息
标题: FERPO: Forward Entropy-Regularized Policy Optimization
作者: Sebastian Sanokowski, Alireza Sarmadi, Majid Khadiv
发布日期: 2026-10-01
arXiv ID: 2610.02198v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决 on-policy 连续控制中 critic 值预测准确但动作梯度不准确、可能误导策略更新的问题。
- 核心方法:FERPO 从熵和 KL 正则化的策略改进目标中构造显式目标动作分布,用前向 KL 拟合策略,并用自归一化重要性采样(SNIS)估计,不计算 。
- 关键结果:在 DMC 上 FERPO 最终 IQM 为 ,略高于 REPPO 的 ;在 DMC 与 ManiSkill 上以更少环境交互达到较高性能(图 4,第 5.4 节)。
- 主要局限:作者承认 critic 值误差、有限样本重要性采样误差、受限高斯策略和更高 GPU 内存使用;在 G1/T1 聚合上 FERPO 最终 IQM 低于 REPPO(第 6 节,表 4)。
- 适合读者:强化学习研究者、机器人学习工程师,以及对最大熵 RL、策略分布匹配和 on-policy 算法感兴趣的读者。
论文背景和研究动机
大规模并行仿真使 on-policy 强化学习在机器人运动和操作中变得高效,也促使研究者重新审视 actor 更新的可靠性。REPPO 等方法通过学到的 soft action-value critic 计算动作梯度来更新策略。但 critic 通常被训练为准确预测价值,价值预测准确并不自动意味着动作导数准确。论文指出,critic 梯度误差可能使策略改进产生偏差;在 on-policy 学习中,数据分布不断变化,这种偏差可能进一步影响稳定性。这正是 FERPO 的核心动机:是否能够只使用 critic 的值 ,而不使用其动作导数,从而避开这个不可靠来源。
另一个动机来自分布拟合方向。论文提出,反向 KL 投影容易只覆盖目标分布的少数模式,而前向 KL 更鼓励覆盖多个高价值模式,有利于探索。因此,如果将熵和 KL 正则化的改进目标显式化,再通过前向 KL 拟合参数策略,就有可能在利用 critic 值的同时获得探索性更好的更新。
核心方法和技术细节
FERPO 首先在固定的 rollout 策略 和 critic 下,最小化带熵和 KL 约束的无限制条件分布上的拉格朗日。引入温度 和信任区域系数 ,得到最优目标分布:
这里 越大,目标越靠近 rollout 策略; 控制价值的温度缩放。该分布来自第 3.1 节和附录 B.2。论文在附录 B.4 中形式化证明:对固定 critic 和温度,若每一步都精确拟合目标并刷新参考策略,则迭代最终收敛到 Boltzmann 分布 ,且 只影响收敛速度而非极限。
FERPO 使用前向 KL 而非反向 KL 将参数策略拟合到 。实际中,从 rollout 策略采样 个候选动作 ,用 critic 值计算权重,并采用自归一化重要性采样:
其中 ,且权重在 actor 更新时被 stop-gradient 固定。这一步只对策略对数概率微分,不对 critic 反向传播。
温度和 都被作为拉格朗日乘子自适应更新。温度更新沿用 SAC 的自动熵调:用 fresh 动作估计熵,最小化 。 更新基于归一化有效样本量 ESS:对每个状态计算 ,最小化 。论文在附录 B.3 的 Proposition 1 中证明,对固定目标,若前向 KL 拟合损失不增加,则 ESS 的下界可转化为策略间 TV 距离的上界,从而把 ESS 控制与信任区域目标联系起来。
critic 训练沿用 REPPO 的设置:多步 TD、HL-Gauss 分类回归,以及辅助自预测损失;未来熵贡献被包含在 soft-return 中。
创新点和贡献
FERPO 的主要贡献是提供了一种不依赖 critic 动作梯度的 on-policy 最大熵策略改进方式。与 REPPO 相比,其 actor 更新只用 的标量输出对采样动作加权,避免了 “价值准确但导数不准确” 的潜在风险。第二,显式熵 + KL 正则目标与前向 KL 拟合结合,鼓励覆盖多个高价值模式。第三,用归一化 ESS 的 log 形式调节 ,直接控制重要性权重集中度,而不是直接约束策略间平均 KL。此外,论文评估了 cached actor updates 和基于 one-step simulation 的 state-value 扩展,以降低重复候选动作评估成本,并在稀疏奖励环境下更直接地利用即时奖励。
实验结果分析
在双峰成本 toy experiment 中,论文展示 FERPO 的目标加权平均会改变更新方向。在参考策略位于两个模态之间时,REPPO 基于当前策略平均成本导数向左移动,FERPO 则向右移动,指向更好的右侧模态(图 1,第 5.1 节)。这说明前向 KL 目标能够对远处高价值区域赋予权重。但论文也报告,直接用 rollout 策略采样时, 下只有 26.4% 的批次能恢复正确方向;把采样 proposal 宽度从 增至 、 后,恢复率分别达到 98.9% 和 99.9%(附录 A.1,表 1)。这在该 toy 设置中说明候选动作覆盖对重要性采样估计至关重要。
计算基准上,FERPO 在 时,uncached 版本的总 actor+critic 更新时间比 REPPO 低 6.9%;cached 版本相对 REPPO 的 actor 更新可合并为约 22.2% 的速度提升(第 5.2 节)。代价是 GPU 内存峰值更高:uncached 高 22.4%,cached 高 25.6%(第 5.2 节/附录 A.2)。
消融实验中,在 G1 flat 任务上, 从 8 增到 16 使 50.07M 步平均回报从 增至 ,但收益递减;将温度设为 0 时,平均回报降至 ,低于自适应温度设置,说明在该任务中最大熵正则化带来更高回报(图 3 左,第 5.3 节)。cached Q 在 G1 flat 上与 uncached 相比最终回报略低:33.58 vs 34.03,但训练时间从 68.4 分钟降至 55.7 分钟,节省 18.6%(图 3 中,第 5.3 节)。在 AcrobotSwingupSparse 上,cached V 扩展的最终回报为 ,远高于 uncached Q 的 (图 3 右,第 5.3 节/附录 A.3.4);但该扩展使用 17 倍的仿真器 transitions,不能直接用相同交互预算比较。
在 benchmark 汇总上,DMC 的 IQM 为:FERPO 、REPPO 、FastTD3 、PPO(Brax)、PPO ;ManiSkill 成功率 IQM 为:FERPO 95.67%、REPPO 95.52%、PPO 84.61%(图 4,第 5.4 节)。在 G1/T1 聚合上,FERPO 为 ,低于 REPPO 的 ;配对 bootstrap 差异为 ,调整后区间为 ,因此在该实验设置和最终共同交互预算下,REPPO 在 G1/T1 上占优(表 4)。所以 FERPO 的优势主要集中在 DMC 和 ManiSkill 的样本效率与墙钟效率,而不是所有基准套件上的全局一致性优势。
实践建议
对于连续控制机器人学习场景,FERPO 的一个实际用途是:当团队已经使用 REPPO 或类似的 on-policy 路径梯度方法、但怀疑 critic 梯度估计不可靠时,可以试验将 actor 更新替换为 FERPO 的 critic-value 加权前向 KL 拟合。若延迟是关键指标,优先使用 cached FERPO;但需注意论文报告在 CheetahRun 上 cached FERPO 的 GPU 内存峰值比 REPPO 高 25.6%(第 5.2 节),且在 G1 flat 设置下 cached 终端回报略低于 uncached(图 3 中,第 5.3 节)。因此建议先在小规模任务上比较 cached 和 uncached 的终端表现,再决定是否固定缓存调度。
对于稀疏奖励任务,尤其是即时奖励形状对动作选择重要时,可以考虑论文的 state-value 扩展;但必须评估额外的 倍模拟器转移是否可接受。作者提供的 Warp 实现只在 AcrobotSwingupSparse 上测得每次迭代约 8.4% 的额外时间(附录 A.3.4)。在动作维度大或奖励表面复杂时,建议先对 和 ESS target 做消融:作者在 G1 flat 上观察到 优于 ,但收益递减;G1/T1 基准使用 ESS target 0.65(第 5.3 节、第 5.4 节)。最后,FERPO 尚未在离散动作空间上实验,作者将其列为未来工作,因此离散控制任务需另行验证。实现代码已公开于 GitHub。