一种代理转移的无模型策略增强技术

arXiv: 2606.09825v1

论文信息

标题: An Agency-Transferring Model-Free Policy Enhancement Technique

作者: Anton Bolychev, Georgiy Malaniya, Sinan Ibrahim, et al.

发布日期: 2026-06-08

arXiv ID: 2606.09825v1

PDF 链接: 下载 PDF

研究背景与动机

强化学习虽然在围棋、游戏、机器人等领域取得了瞩目的成就,但从零开始训练策略仍然成本高昂。算法落地往往依赖精细的奖励设计、大量的超参数调优和充足的计算资源,这使许多实践者在面对具体控制问题时望而却步。然而,在很多实际场景中,工程师已经拥有一个能够完成基本任务的次优策略,例如物流运输中的启发式路由算法、金融交易里的粗粒度规则,或者机器人领域里基于传统控制理论的稳定控制器。这些现有策略虽然无法最大化目标指标,却蕴含了丰富的领域先验知识。

上述现象催生了一个自然的问题:能否利用已有的功能性策略作为基线,将其嵌入强化学习训练过程,既提升训练效率,又最终获得超越基线的独立策略?现有方法,如残差强化学习,通过在学习策略的输出上叠加基线策略的动作来实现这一点,但它们在部署阶段仍然依赖基线策略,且缺乏对训练早期目标可达性的形式化分析。论文《An Agency-Transferring Model-Free Policy Enhancement Technique》正是针对这一缺口,提出了一种无模型的策略增强技术,能够在训练过程中逐步将控制权从基线策略转移给可学习的神经网络策略,并首次提供了关于目标可达概率的理论解释。

核心方法:渐进式代理转移

该方法的核心是在标准强化学习交互环路中引入一个仲裁模块。在每一个时间步,仲裁模块根据当前状态和学习策略与基线策略的候选动作,动态决定实际执行的动作来自哪一方。形式上,执行动作 AtA_t 由以下混合分布采样:

At(1αt)πb(St)+αtπθt(St)A_t \sim (1-\alpha_t) \pi^{\mathrm{b}}(\cdot \mid S_t) + \alpha_t \pi^{\theta_t}(\cdot \mid S_t)

其中 πb\pi^{\mathrm{b}} 是基线策略,πθt\pi^{\theta_t} 是参数为 θt\theta_t 的学习策略,αt[0,1]\alpha_t \in [0,1] 是一个随时间变化的混合系数,代表了 “代理权” 的归属程度。仲裁模块的巧妙之处在于 αt\alpha_t 的设计:它结合了评论家(critic)驱动的确定性接受概率松弛两种机制。

具体而言,在每个回合开始时,算法维护一个回合局部的最佳评论家值 QtQ_t^\dagger。如果候选学习动作的评论家估计 Qw(St,Atπθ)Q^w(S_t, A_t^{\pi^\theta})QtQ_t^\dagger 高出至少一个阈值 ν\nu,则 αt=1\alpha_t=1,完全信任学习策略。否则,按照一个随时间衰减的概率 prelλtτp^{\mathrm{rel}} \lambda^{t-\tau} 随机采纳学习动作,这里 prelp^{\mathrm{rel}}λ\lambda 是超参数,τ\tau 是回合起始时刻。这种设计具有明显的模拟退火特征:改善的动作被确定性地接受,而非改善动作仍有一定的尝试机会,且机会随回合推进而减小。

在训练过程中,通过过渡调度策略逐步提高 prelp^{\mathrm{rel}}λ\lambda 的值,使得学习策略被调用的期望次数线性增长。训练的初期, λ\lambda 很小,基线策略承担大部分行动,保证了高目标达成率;而到了预设的过渡时刻 TtranT_{\mathrm{tran}} 后,两个参数均达到 1,仲裁机制自然退化为纯学习策略决策,基线策略不再参与,最终产出一个独立的神经网络策略。

该方法与主干强化学习算法(如 TD3、SAC、PPO 等)完全解耦,只需在采集交互数据时插入仲裁逻辑,不修改任何损失函数或梯度更新流程,因此实现简单且通用性强。

理论分析:目标可达性的形式化保障

论文的一大亮点在于为目标可达性提供了严谨的理论解释。作者首先将 “功能性基线” 形式化为 ε\varepsilon-不可能目标可达性质:基线策略 πb\pi^{\mathrm{b}} 从任意状态出发,最终到达并保持在目标集 G\mathbb{G} 内的概率至少为 1ε1-\varepsilon

在训练早期(t<Ttrant < T_{\mathrm{tran}}),由于 λ<1\lambda<1,概率松弛分支的触发次数有限,评论家改善分支也因评论家值有上界而只能触发有限次。因此,复合策略 πt\pi_t 在有限时间后几乎必然与基线策略重合,从而继承了基线的目标可达性(定理 1)。该结论解释了实验中观察到的训练初期就能保持高目标达成率的现象。

更进一步,论文给出了一个更强的均匀版本(定理 2)。在假设评论家值可被连续包络函数上下界定的条件下,复合策略 πt\pi_t 的轨迹不仅几乎必然收敛到目标集,还具有均匀的有界超越和明确的到达时间分布。这意味着,在基线策略本身具备 KL\mathcal{KL} 类收敛证书时,学习策略的插入不会引起发散,且整个闭环系统在大概率下最终稳定在目标附近。

当训练结束、基线完全移除后,学习策略 πθ\pi^{\theta} 独立运行时的目标可达性是否会崩溃?定理 3 通过轨迹距离传递分析回答了这一问题:若在基线下策略 πt\pi_t 能以 1ε1-\varepsilon 的概率在时间 TT 内稳定在目标集的 dd^* 邻域内,且 πθ\pi^{\theta}πt\pi_t 的期望轨迹距离有上界 ΔT\Delta_T,则 πθ\pi^{\theta} 以不低于 1εΔT/δ1-\varepsilon - \Delta_T/\delta 的概率停留在 (d+δ)(d^*+\delta) 邻域内。这一结果清楚地展示了转移过程中性能损失的量化边界,为独立策略的可靠性提供了理论保证。

实验结果与分析

实验在两个精心设计的连续控制任务上进行:“污染区域自主水下航行器(AUV)导航” 和 “寻宝机器人”。两个环境都具有明确的目标集、可显式构造的基线策略,且奖励结构存在优化空间,能直观展示目标达成率和任务特定指标。

以 TD3 和 SAC 为主干,对比了标准算法、残差强化学习变体和所提方法。训练总步数为 300 万步,过渡时刻设为 270 万步,最后 30 万步完全由学习策略独立运行。

目标达成率方面,所提方法在两个环境和两种主干下均取得了最高的最终阶段目标达成率。例如,在 AUV 任务中,基于 TD3 的所提方法达到了 99.15%99.15\% 的目标达成率,而残差 TD3 为 95.6%95.6\%,标准 TD3 仅为 76.35%76.35\%。更加显著的是,训练开始阶段的目标达成率曲线(图 9、图 11)显示,所提方法几乎从第一步起就维持了极高的达成率,而其他方法的达成率要么从极低开始缓慢上升,要么波动剧烈。这直观验证了基线嵌入和仲裁机制的有效性。

任务特定指标同样支持方法的优势。在 AUV 任务中,所提方法获得了最低的污染侵入深度(平均值 0.00520.0052 ~ 0.010.01),意味着更好的避障能力;在寻宝任务中,虽然所有方法都容易收集到宝藏,但所提方法在保持高收集率的同时,目标达成率和综合得分遥遥领先(TD3 主干综合得分 96.95%96.95\%,远高于残差 TD3 的 87.71%87.71\%)。

消融实验证实了评论家值跟踪机制(以 ν\nu 参数控制)的关键作用。关闭跟踪后,学习策略调用比例大幅降低,训练回报和最终性能均明显下降,说明确定性改善接受分支对加速代理转移和稳定训练至关重要。此外,对基线移除时刻 TtranT_{\mathrm{tran}} 的分析表明,过早移除会导致目标达成率下降,适当延后则使转移更加平滑。

实践应用建议与未来方向

对于面临类似问题的工程师和研究人员,以下几点实践建议值得参考:

  1. 基线的选择:应选择一个能够稳定完成任务但非最优的策略,即使它存在明显的次优行为(如总是穿越污染区)。该基线只需满足功能性需求,无需对其本身进行强化学习微调。
  2. 超参数初始化:建议 p0rel[0.8,1.0]p_0^{\mathrm{rel}} \in [0.8, 1.0],并通过 λ0\lambda_0 使初始期望学习策略调用比例约为 20%20\%,以确保早期数据以基线为主,防止训练分布崩塌。过渡时长 TtranT_{\mathrm{tran}} 可设置为总训练步数的 90%90\% 左右。
  3. 评论家正则化:尽管理论分析中假设了评论家的上下界包络,实际中若使用输出裁剪或谱归一化,也能取得稳定效果,且不需精确满足理论条件。
  4. 评估指标多元化:除了累积回报,务必监控目标达成率、约束违反等面向任务的指标,它们对解释方法在安全关键领域中的行为尤为重要。

未来方向包括:将该框架扩展到多智能体系统和离散动作空间;探索自动调整 ν\nuTtranT_{\mathrm{tran}} 的自适应机制;以及在真实机器人平台上进行更复杂的迁移学习验证,结合从仿真到现实的领域随机化。

总结与展望

该论文提出了一种新颖且实用的强化学习策略增强技术,通过仲裁模块将已有基线策略有机融入训练,实现了控制权的渐进式、平滑转移。方法在保持极高训练效率的同时,最终产生了一个完全独立的、超越基线的神经网络策略。理论分析首次揭示了训练早期高目标达成率的机理,并量化了基线移除后的性能退化边界,为同类方法的形式化分析铺平了道路。实验结果表明,无论是在目标达成率、避障性能还是综合任务得分上,所提方法均优于标准 RL 和残差 RL。该框架实现简洁、与主干算法解耦,对于拥有现成控制器的众多工业场景具有极高的应用价值,有望成为将领域知识注入深度强化学习训练的标准范式。