基于 Q 值的变分逆强化学习
Q-based Variational Inverse Reinforcement Learning
论文信息
标题: Q-based Variational Inverse Reinforcement Learning
作者: Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, et al.
发布日期: 2026-08-17
arXiv ID: 2608.16888v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决 Bayesian 逆强化学习长期存在的 “可扩展性与完整后验不确定性不可兼得” 问题:MCMC 方法通常只适用于小型状态/动作空间,而 AVRIL 等可扩展方法又放弃了对最优 Q 值的完整不确定性建模。
- 核心方法:提出 QVIRL,主要在最优 Q 值空间学习一个高斯或高斯过程变分后验,再通过逆 Bellman 方程推出奖励后验,从而避免反复求解前向强化学习问题。
- 关键结果:在 100 个随机 8×8 网格世界中,QVIRL 的 90% 可信区间覆盖率为 0.901,接近 MCMC 参考方法 ValueWalk 的 0.888,而 AVRIL 只有 0.521(表 1);论文还首次展示 Bayesian IRL 从 ATARI 原始像素观测训练。
- 主要局限:连续状态环境中 KL 项需要在专家状态之外加入辅助状态,并引入权重 ;在 CVaR 尾部保真上,QVIRL-CVaR 的后验 CVaR 回报仍低于 ValueWalk-CVaR(表 2)。
- 适合读者:研究模仿学习、逆强化学习、贝叶斯深度学习、主动学习,以及机器人、自动驾驶、游戏 AI 等安全关键强化学习应用的人。
论文背景和研究动机
Russell 提出的有益 AI 三原则中,AI 应对人类偏好保持初始不确定性,并通过人类行为获取偏好信息。Bayesian 逆强化学习可以看作这些原则的可操作化:从奖励先验出发,利用人类专家的近似最优示范得到奖励后验。非贝叶斯 IRL 已在机器人、导航和自动驾驶等现实场景中取得应用,但通常只学一个奖励点估计。论文指出,IRL 本质上具有欠定性:即使有无穷多示范,也可能存在多个同样能解释行为的奖励函数;有限示范进一步带来不确定性。
贝叶斯 IRL 通过后验分布解决该问题,可用于鲁棒策略或主动学习。然而现有方法中,MCMC 类方法如 ValueWalk 能采样真实后验,但计算量大、难以扩展到高维;AVRIL 虽然利用变分推断提升了可扩展性,却只对 Q 函数建模点估计,奖励后验方差也被大幅压缩。QVIRL 的动机因此很明确:在保持可扩展性的同时,不牺牲对最优 Q 值与奖励的后验不确定性建模。
核心方法和技术细节
QVIRL 的核心是在最优 Q 值空间进行变分推断。Q 值后验一旦确定,奖励后验可以通过逆最优 Bellman 方程一步推出:
模型用一个编码器网络对任意状态-动作对输出三个量:最优 Q 值的均值 、对数标准差 ,以及潜在嵌入 。对一组状态-动作对,联合后验通过式(2)给出均值向量和协方差矩阵,其中协方差由各点标准差与 RBF 核的乘积构成:
这一步显式建模 Q 值之间的相关性,是 QVIRL 区别于 AVRIL 的关键之一。
从 Q 值到奖励时,难点在于 是联合高斯随机变量的最大值,没有解析形式。论文使用 Clark 近似:对两两高斯变量的最大值进行矩匹配,再逐对递归,最终把后继状态值 近似为高斯分布。得到的奖励也是高斯分布,其均值和方差由式(4)给出。作为简化替代,论文也测试了 max-mean 近似,即直接用后验均值最高的动作对应的 Q 值代替最大值;论文在附录 B.1 中说明,在多数状态中该近似不引入误差,但在后验收缩较弱、最优动作不确定的状态中会产生偏差。
专家动作似然采用 Boltzmann 理性模型,但 softmax 对联合高斯变量的积分没有解析解。QVIRL 采用 Lu 等人的近似,将概率写成式(6)的形式,其中 Q 值差的均值被一个包含方差和协方差修正项的分母缩放。训练目标为 ELBO 形式:
在离散环境中,KL 可解析计算;在连续环境中,论文在专家 transitions 之外引入辅助 transitions,并在联合高斯奖励后验上计算 mini-batch KL,形成式(22)。辅助数据可以来自当前学徒策略 rollout、离线数据或随机采样。论文特别指出,只在专家数据上训练后验无法覆盖未被专家访问的状态空间,因此建议使用辅助数据。
创新点和贡献
QVIRL 的主要贡献可以概括为三点。第一,它是首个在最优 Q 值空间显式建模联合后验的变分 Bayesian IRL 方法。相比 AVRIL,它不仅保留奖励后验,还保留 Q 值后验,从而能用于风险敏感策略和现有主动学习采集函数。第二,它避免了 MCMC 方法反复求解前向 RL 的计算负担,同时借助变分推断和神经网络编码器扩展到了高维、连续状态甚至原始像素观测。论文声明,这是第一个能从原始像素观测训练 Bayesian IRL 的方法。第三,QVIRL 为主动 IRL 提供了一个可扩展的贝叶斯骨干。现有采集函数如 Reward EIG 和 ActiveVaR 需要 Q 值不确定性估计,MCMC 方法难以扩展,而 AVRIL 不提供 Q 后验。
实验结果分析
在 100 个随机 8×8 网格世界中,论文以 ValueWalk 的 MCMC 样本作为近似真实后验,评估 QVIRL 和 AVRIL 的后验质量(表 1)。QVIRL 的 距离为 0.486,显著小于 AVRIL 的 1.704;其 90% 可信区间覆盖率为 0.901,接近 ValueWalk 的 0.888,而 AVRIL 仅为 0.521。论文据此认为,在该实验设置下,QVIRL 的后验近似比 AVRIL 更接近 MCMC 参考后验,且校准性更好。
在学徒学习任务中,网格世界的结果(表 2)显示,QVIRL 均值策略的真实奖励归一回报为 70.8,低于 ValueWalk 均值策略的 75.4,但明显高于 AVRIL 均值策略的 -22.2。CVaR 策略的结果表明,QVIRL-CVaR 的后验 CVaR 回报为 49.7,而 ValueWalk-CVaR 为 62.1,说明 QVIRL 对后验尾部风险的建模虽已可用,但在该指标上仍未达到 MCMC 参考的水平。在 Lunar Lander 和 Highway 连续控制环境中,图 3 显示 QVIRL 在较少示范时更快达到专家级表现,且多次运行间波动更小;图 4 显示其在 held-out 专家动作上的对数似然从单条轨迹起就较高。在 ATARI 的 Pong 和 Space Invaders 上,QVIRL 的原始回报分别为 19.7 和 701,与 IQ-Learn 的 20.0 和 740 具有可比性(表 3),但 QVIRL 额外提供 Q 值不确定性。
主动学习实验(图 5)中,QVIRL 与 Reward EIG 结合在网格世界中接近 ValueWalk,而 AVRIL 在约 10 次查询后性能停滞;在 Lunar Lander 中,QVIRL 与 Reward EIG 或 ActiveVaR 结合均明显优于随机查询。论文认为,这支持了 QVIRL 作为可扩展贝叶斯后端的可行性。
实践建议
如果目标是仅拟合专家策略并且不需要不确定性,IQ-Learn 等点估计方法已足够强;但如果系统需要风险敏感策略、主动数据采集或后验校准,则可以优先考虑 QVIRL。尤其当任务状态空间较大、使用连续控制或图像观测时,QVIRL 比 MCMC 方法更易部署。
在连续状态环境中实践时,不应只在专家轨迹上计算 KL。论文明确建议加入辅助 transitions,以覆盖专家未访问的状态区域。辅助数据可以来自当前学徒策略 rollout 或离线非专家轨迹;这会引入连续版损失中的权重 ,因此需要进行调参。实现时,论文在附录 A.2 推荐先实现更简单的 max-mean 近似,待流程跑通后再替换为 Clark 近似以提升后验精度。
对于安全关键或风险敏感的应用,QVIRL 的后验可以自然支持 CVaR 策略,但需要注意:在本次评测的网格世界中,QVIRL-CVaR 的尾部性能仍弱于 ValueWalk-CVaR(表 2)。因此在真实部署中,如果尾部风险极其重要,建议保留更保守的安全裕度,或在关键区域用额外数据或 MCMC 做局部验证。
在主动学习场景中,可将 QVIRL 作为 Reward EIG 或 ActiveVaR 的贝叶斯后端,尤其在无法使用 MCMC 的大规模环境中。先在小规模仿真环境里验证采集函数与后验更新的配合,再迁移到真实环境,是一种较稳妥的落地路径。