你真的需要为在线强化学习微调预训练 Q 函数吗?

Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?

arXiv: 2607.27203v1

论文信息

标题: Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?

作者: Perry Dong, Ron Polonsky, Dorsa Sadigh, et al.

发布日期: 2026-07-29

arXiv ID: 2607.27203v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题: 论文要解决在强化学习(RL)微调中,从预训练策略出发时,预训练 Q 函数是否真的有助于提升在线微调的性能。
  • 核心方法: 论文通过系统性实证分析,发现朴素预训练 Q 函数无效的根本原因是其学习到了错误的目标(Qπbase≠QπRL∗Q^{\pi_{\text{base}}} \neq Q^{\pi^{*}_{\text{RL}}}),并提出了名为 IPE(策略集成初始化)的新方法。
  • 关键结果: 提出的 IPE 方法在挑战性的连续控制任务基准上,相比直接预训练 Q 函数,微调性能平均提升了 1.26 倍(见论文第 6 节)。
  • 主要局限: 分析主要聚焦于离策略 RL,IPE 方法需要从多个不同策略收集数据,引入了额外的数据收集开销(见论文第 7 节)。
  • 适合读者: 所有从事强化学习,特别是离线到在线 RL、机器人学习、以及基于预训练模型进行下游任务微调的研究人员和工程师。

论文背景和研究动机

近年来,“预训练 + 微调” 已成为机器学习领域的主流范式,从大语言模型到机器人控制,该范式都取得了巨大成功。通常,我们不仅预训练一个策略模型(比如通过监督学习模仿专家数据),还会预训练一个 Q 函数,它负责评估在特定状态下采取某个动作的好坏,为策略的在线学习提供梯度信号。一个直觉性的假设是:既然策略需要预训练,那么用来指导策略更新的 Q 函数也应该利用离线数据预训练,从而让在线微调有一个更好的起点。

然而,近期的一些工作发现,即使不预训练 Q 函数,仅从一个随机初始化的 Q 函数和一个预训练的策略开始在线 RL,也能取得高度可靠和优秀的性能。这一观察直接挑战了上述直觉。论文提出的核心问题是:当给定一个预训练好的基策略(πbase\pi_{\text{base}})时,我们是否真的需要对 Q 函数进行预训练? 这个问题具有重大的实践价值,因为大规模预训练策略(如 VLA 视觉-语言-行动模型)的流程可能非常复杂且昂贵,若能证明无需预训练 Q 函数,将大大简化训练管线。

核心方法和技术细节

为了回答上述问题,论文首先进行了一系列精心设计的实验来剖析 Q 函数预训练的效果及其失效原因。

分析:为什么预训练 Q 函数无效?

论文的实验得出了一个反直觉的发现:朴素的 Q 函数预训练相比随机初始化,几乎不会带来在线微调性能的提升,甚至在某些任务上是有害的(见论文图 2)。作者们深入探究了其中原因。

核心问题在于一个本质性的不匹配:通过离线数据预训练得到的 Q 函数是 QπbaseQ^{\pi_{\text{base}}},即在基策略下的价值函数;而在线 RL 微调要学习的 Q 函数是最优的 QπRL∗Q^{\pi^{*}_{\text{RL}}}。两者目标不同,因此离线学到的知识并不能直接帮助在线学习。论文设计了一个 “偏好准确率” 指标来验证这一点:即使基策略 πbase\pi_{\text{base}} 被训练到接近 100% 的成功率,其对应的 QπbaseQ^{\pi_{\text{base}}} 在偏好动作时,与最优的 QπRL∗Q^{\pi^{*}_{\text{RL}}} 仍然存在显著差异(见论文图 3)。这意味着,无论离线数据多么完美,预训练 Q 函数都会收敛到一个错误的目标上。

一个自然的想法是在预训练阶段就进行 “价值最大化”,即不是学习 QπbaseQ^{\pi_{\text{base}}},而是尝试逼近 QπRL∗Q^{\pi^{*}_{\text{RL}}}。论文测试了三种方法:学习一个编辑策略来修改基策略的动作以最大化 Q 值、蒸馏一个最大化 Q 值的单步策略、以及直接在动作上应用梯度来最大化 Q 值。遗憾的是,这些尝试均不能有效拉近离线 Q 函数与 QπRL∗Q^{\pi^{*}_{\text{RL}}} 的距离,也无法提升最终性能(见论文图 4 和图 5)。这说明,弥合这一差距所必需的在线交互和数据是无法被离线数据完全替代的。

解决方案:策略集成初始化(IPE)

基于上述分析,论文观察到单个预训练策略产生的动作分布非常狭窄,这导致其预训练的 Q 函数几乎退化为一个状态价值函数 VπbaseV^{\pi_{\text{base}}},因为它在每个状态下只看到一类动作(见论文图 6 和图 8)。这极大地限制了 Q 函数分辨不同动作好坏的能力。

为此,论文提出了一个简单而巧妙的方法——策略集成初始化(IPE)。IPE 的核心思想是打破单一策略的局限性:

  1. 在已有的离线数据集上,使用不同的随机种子或数据子集,训练出 NN 个不同的、但都模仿基策略 πbase\pi_{\text{base}} 行为分布的策略 {π1,…,πN}\{\pi_1, \dots, \pi_N\}。
  2. 依次使用这些策略(包括原始的 πbase\pi_{\text{base}})与环境进行交互,收集多样化的轨迹数据,并将其全部放入回放缓冲区。
  3. 从这 N+1N+1 个策略汇集而成的、更具多样性的数据中,学习和初始化 Q 函数,然后开始在线 RL 微调。

IPE 的精妙之处在于,它没有改变离线数据的分布,而是通过引入 “策略多样性”,为 Q 函数提供了在相同状态下对比不同动作的机会。这使得 Q 函数不再局限于学习 QπbaseQ^{\pi_{\text{base}}},而是能更早地、更好地捕捉到接近 QπRL∗Q^{\pi^{*}_{\text{RL}}} 的价值结构,从而为在线微调提供一个更有效的起点。

创新点和贡献

  1. 挑战了预训练的常识: 论文首次通过系统性实证研究,明确指出了在基于预训练策略进行 RL 微调时,朴素预训练 Q 函数不仅可能无效,甚至有害,其根源在于学习目标的根本性错配(Qπbase≠QπRL∗Q^{\pi_{\text{base}}} \neq Q^{\pi^{*}_{\text{RL}}})。这一发现纠正了领域内 “预训练越多越好” 的直觉。

  2. 提供了一种低成本、高收益的改进方案(IPE): 不同于复杂的离线 RL 算法,IPE 是一个极其简洁的实现。它不要求修改复杂的离线训练流程,只需利用离线数据训练多个同分布的 “姊妹” 策略,收集它们的在线交互数据即可。这种方法将问题从 “如何逼近最优 Q?” 巧妙地转化为 “如何为 Q 函数学习提供更好的数据分布?”。

  3. 揭示了 Q 函数学习中的数据多样性需求: 论文通过实验和可视化清晰地展示了,单一专家策略的动作覆盖不足会导致 Q 函数崩溃,而多样化的动作覆盖是其有效学习的关键。这一见解对未来的 Q 函数训练提供了重要指导。

实验结果分析

论文在 Robomimic 和 OGBench 的六个具有挑战性的机器人操作任务上评估了 IPE 的有效性。实验结果显示:

  • IPE 显著优于基线和朴素预训练: 在所有六个任务上,使用 IPE 进行 Q 函数初始化的微调性能,在最终成功率和学习速度上都一致地优于使用朴素预训练 Q 函数和随机初始化 Q 函数的方法(见论文图 7)。平均带来了1.26 倍的性能提升(见论文图 1)。

  • 性能随策略数量 NN 扩展: 在控制总数据量不变的情况下,增加用于 IPE 的策略数量 NN 可以持续提升下游微调性能,直到 N=5N=5 时达到最佳效果(见论文图 9)。这证实了 IPE 性能提升的核心驱动力是策略多样性带来的数据分布多样性,而非简单的数据量增加。

实践建议

对于在机器人或类似领域从事 RL 微调工作的工程师和研究者,本文提供了极具价值的实践指导:

  1. 跳过朴素 Q 预训练: 如果你的基策略是通过行为克隆等监督学习方法得到的,那么在开始在线 RL 微调时,可以放弃对 Q 函数进行基于策略动作的朴素离线预训练。实验证明这通常是徒劳的。

  2. 采纳 IPE 的低开销版本: 实现 IPE 非常直接。如果你拥有独立的离线数据集,可以从中分割出几个子集,或者使用不同的随机种子,训练 NN(例如 3 到 5 个)个和基策略同架构的策略。在开始在线微调前,先在环境中部署它们以收集少量轨迹来预热回放缓冲区。这种方法能有效提升后续微调的样本效率和最终性能。

  3. 专注于提升数据多样性: IPE 的核心启示是,在微调初期为 Q 函数提供多样化的动作-结果对是至关重要的。在无法获得多个策略的情况下,应考虑其他增加动作覆盖率的方法,例如在收集预热数据时向基策略加入适量的噪声,确保 Q 函数在学习初期能接触到足够丰富的动作评价信号,避免其价值估计的坍塌。