一种代理权转移的无模型策略增强技术

An Agency-Transferring Model-Free Policy Enhancement Technique

arXiv: 2606.09825v1

论文信息

标题: An Agency-Transferring Model-Free Policy Enhancement Technique

作者: Anton Bolychev, Georgiy Malaniya, Sinan Ibrahim, et al.

发布日期: 2026-06-08

arXiv ID: 2606.09825v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决什么问题? 强化学习从头训练成本高昂,但许多控制问题已存在一个能完成任务但性能次优的基线策略。本文研究如何将这样的基线策略嵌入 RL 训练过程,在提升训练效率的同时,最终产出一个超越基线、且可独立运行的神经网络策略。

  • 核心方法:用什么办法解决? 提出一种 “代理转移” 方法,在训练时通过仲裁模块逐步将行动决策权从基线策略转移到可训练的学习策略。仲裁基于批评家价值改善条件与概率松弛机制,初始阶段高度依赖基线,训练后期学习策略完全独立运行。

  • 关键结果:最重要的一个结论或数字是什么? 在污染区 AUV 导航任务中,所提方法以 TD3 为主干时最终目标达成率达 99.15%,高于残差 TD3 的 95.60% 和普通 TD3 的 76.35%,且整个训练过程中的目标达成率均保持最高(见表 2,图 9)。

  • 主要局限:作者自己承认的、或方法本身固有的限制是什么? 理论分析假设回合长度无界或足够长;实践中若回合长度不足,基线恢复效应可能无法完全显现。此外,基线策略需具备 “功能性”(至少能到达目标区域),这限制了该方法在缺少有效基线场景中的直接应用。

  • 适合读者:什么背景的人值得读? 从事强化学习、机器人控制、游戏 AI 或任何已有次优控制器(如 PID、启发式规则)但希望用学习型策略加以提升的研究者和工程师。

论文背景和研究动机

现代强化学习虽已取得瞩目成就,如 AlphaGo、OpenAI Five、AlphaStar 等,但训练一个 RL 智能体仍然颇具挑战。超参数选择、环境设计、计算资源需求往往使得从零开始的训练耗时长、结果不稳定。许多实际控制场景中已经存在一个 “能用但不优” 的策略——比如物流公司的启发式调度算法、金融交易员的规则型策略、机器人工程中的稳定化控制器。这些基线策略能完成任务,但在效率、收益或能耗上存在优化空间。

该论文的核心出发点正是利用这些已有的基线策略来改善 RL 训练过程。作者特别关注一类 “目标导向” 问题:智能体需要在环境中到达某个目标区域并保持在该区域内。在这种设置下,基线策略即便没有经过学习,通常也能以较高概率达成目标。

与从演示中学习或残差强化学习等已有方法不同,该文提出的方法在训练阶段使用基线策略作为 “临时能力支架”,但在部署阶段完全移除基线,产出一个独立的神经网络策略。这一设计使得最终策略在运行时不需要任何外部控制器资源(表 1 总结了与相关方法族的差异)。

核心方法和技术细节

仲裁模块与代理转移

该方案的核心是一个仲裁模块(arbitration module),它在每个时间步决定执行的动作来源于学习策略 πθ\pi^{\theta} 还是基线策略 πb\pi^{\mathrm{b}}。形式化为混合系数 αt∈[0,1]\alpha_t \in [0,1]:

At∼(1−αt)πb(⋅∣St)+αtπθt(⋅∣St)A_t \sim (1-\alpha_t) \pi^{\mathrm{b}}(\cdot\mid S_t) + \alpha_t \pi^{\theta_t}(\cdot\mid S_t)

其中 αt\alpha_t 由两组并行条件决定(算法 1,第 4–11 行):

  1. 批评家价值改善条件:若学习策略候选动作的批评家估值 Qw(St,Atπθ)Q^{w}(S_t, A_t^{\pi^{\theta}}) 超过当前回合内的最佳批评家记录 Qt†Q_t^{\dagger} 至少 ν\nu(超参数),则确定性选择学习动作。Qt†Q_t^{\dagger} 在每个回合初始重置并在线更新。

  2. 概率松弛条件:若改善条件不满足,则以概率 prelλt−τp^{\mathrm{rel}} \lambda^{t-\tau} 仍然接受学习动作,其中 tt 为全局时间步,τ\tau 为当前回合开始时间,λ<1\lambda < 1 使得该概率在回合内呈几何衰减。此机制类似于模拟退火中的非改善邻居接受概率。

通过这样的设计,αt=1\alpha_t=1 的触发概率在训练初期保持较低水平,大部分动作仍由基线策略产生。随着训练进行,prelp^{\mathrm{rel}} 和 λ\lambda 被调度逐步增加至 1,最终 αt=1\alpha_t=1 几乎必然成立,学习策略完全接管行动选择。

过渡调度策略

调度参数 prelp^{\mathrm{rel}} 和 λ\lambda 的更新通过控制学习策略每回合期望激活次数的下界来实现(算法 2,第 6–9 行):

E[∑t=τT+τ−1I{At=Atπθ}]≥prel∑t=0T−1λt\mathbb{E}\left[\sum_{t=\tau}^{T+\tau-1} \mathbb{I}\{A_t = A_t^{\pi^{\theta}}\}\right] \geq p^{\mathrm{rel}} \sum_{t=0}^{T-1} \lambda^{t}

该下界在训练过程中从较小的初始值线性增长至回合长度 TT,从而保证代理转移既不过快也不过慢。作者建议的实践经验是 p0rel∈[0.8,1.0]p_0^{\mathrm{rel}} \in [0.8, 1.0],且初始期望学习动作比例约 20%,以避免训练数据几乎全部由基线策略生成。

理论分析要点

论文提供了较为系统的理论分析,主要分三个层次:

定理 1(无界回合下的目标达成继承):在 λ<1\lambda < 1、批评家一致有上界、且基线策略满足 ε\varepsilon-可达成目标性质的条件下,由仲裁机制产生的复合策略 πt\pi_t 同样满足 ε\varepsilon-可达成目标性质。证明思路为:批评家改善条件最多触发有限次(因批评家有界),松弛条件因 ∑prelλt<∞\sum p^{\mathrm{rel}}\lambda^t < \infty 也几乎必然有限次触发,因此在某个随机时刻后复合策略等同于基线策略,继承其目标达成性质。

定理 2(均匀目标达成分析):在额外的批评家包络假设和基线策略满足均匀 KL\mathcal{KL}-证书的条件下,给出了超调有界性、均匀到达时间及到达时间分布的显式构造。该结果中的批评家单调性门控 ρtrel\rho_t^{\mathrm{rel}} 在实践算法中未强制使用,仅用于分析中的严谨性。

定理 3(代理转移):通过定义两种部署模式(有基线支持 R1R_1 与纯神经网络 R2R_2)下的期望轨迹距离 DT(πθ,πt)D^T(\pi^{\theta}, \pi_t),证明了若该距离有界 ΔT\Delta_T,则纯神经网络策略的目标到达概率下界为 1−ε−ΔT/δ1 - \varepsilon - \Delta_T / \delta(δ\delta 为容许的邻域松弛)。该结论为基线移除后的性能退化提供了可量化的刻画。

实验结果分析

实验设置

论文在两个自定义环境中验证:污染区自主水下航行器导航(6 维状态空间,需导航至水面目标并避开抛物线形污染区)和宝藏收集机器人(7 维状态空间,需收集移动宝藏后到达目标)。基线策略分别为 PD 控制器和几何导引律,都只能完成基础任务而无法优化辅助目标。

实验基于 CleanRL 的 TD3 和 SAC 实现,与普通版本和残差 RL 版本进行对比(残差 RL 采用 At=Atπb+AtπθA_t = A_t^{\pi^{\mathrm{b}}} + A_t^{\pi^{\theta}} 的加性组合)。训练总步数 3M,基线移除时间 Ttran=2.7T_{\mathrm{tran}} = 2.7M。

关键发现

  1. 全程最高的目标达成率:在 AUV 环境中,所提方法的目标达成率在训练初期即接近 100%,明显优于残差 RL 和从零训练的方法(图 9、图 11)。这一行为在定理 1 中获得形式化解释:仲裁机制保留了基线策略的目标达成能力。

  2. 最终独立策略表现最优:即使基线在 2.7M 步后完全移除,学习策略仍取得最高目标达成率。在 AUV 任务中,该方法(TD3 主干)的最终目标达成率为 99.15%,高于残差 TD3 的 95.60% 和普通 TD3 的 76.35%(表 2)。在宝藏收集任务中,综合得分(目标达成率与宝藏收集率的均值)为 96.95%,同样最高(表 3)。

  3. 消融实验:禁用批评家价值追踪(ν=∞\nu = \infty)后,学习曲线下降且基线调用频率显著增加(图 12、图 13),说明该机制对代理的高效转移至关重要。提前移除基线(减小 TtranT_{\mathrm{tran}})则导致目标达成率下降(图 14),验证了充分的受保护学习期的重要性。

实践建议

该方法特别适用于以下工程场景:

  1. 已有次优控制器但追求更高性能:若您的系统已有 PID 控制器、启发式规则或传统规划算法,可以将其作为基线策略嵌入本框架,在其基础上训练神经网络策略以优化能耗、速度或避免惩罚区域。

  2. 目标导向型任务的快速部署:在需要智能体稳定到达目标区域且不希望训练初期频繁失败的应用(如工业机械臂归位、无人机降落到充电站),该方法的仲裁机制能保持早期探索期的安全性。

  3. 超参数设定参考:

    • p0relp_0^{\mathrm{rel}} 建议在 0.8–1.0 之间,λ0\lambda_0 选择使初始期望学习动作比例约为 20%
    • ν\nu 设置为较小的正值(论文用 0.01),以保证批评家门控不会过于保守
    • TtranT_{\mathrm{tran}} 需确保学习策略在无基线支持前累积足够经验,建议占总训练步数的 90% 左右
  4. 批评家实现注意事项:理论分析虽假设批评家输出有界,但实践中即使不显式约束也能工作(见备注 6)。若需满足理论假设,可通过输出裁剪或终端激活函数(如 Qˉ−∣x∣\bar{Q} - |x|)确保批评家有上界。