基于行为潜变量的可控模拟智能体

arXiv: 2607.02496v1

论文信息

标题: Controllable Sim Agents with Behavior Latents

作者: Juanwu Lu, Junyu Zhu, Ziran Wang

发布日期: 2026-07-02

arXiv ID: 2607.02496v1

PDF 链接: 下载 PDF

研究背景与动机

自动驾驶车辆大规模部署对安全验证提出了极高要求,但真实道路测试成本高昂且风险不可控。数据驱动的交通仿真为自动驾驶测试提供了一条可行路径,通过生成逼真且可交互的交通参与者行为,工程师能够在不冒真实风险的前提下复现边缘场景、隔离变量并高效测试规划算法。然而现有方法存在明显短板:基于模仿学习的模型虽然能够产生多样化的轨迹,却普遍缺乏细粒度的可控性,难以按需定向调整智能体行为;而基于强化学习的自博弈方法虽能通过奖励函数塑造行为,但依赖昂贵的在线训练,且奖励规格一旦变化就需要重新训练。近期基于扩散模型的方法通过注入引导信号改善了可控性,但风格化轨迹的引导调参极为困难,过度引导又会引发轨迹失真。如何在保持轨迹真实感的同时,提供便捷、可解释的行为控制接口,是本领域亟待解决的问题。

在此背景下,本文提出了可控神经变分智能体(CNeVA)框架。作者将交通参与者异质性抽象为一种潜在行为偏好——每个智能体对共享的语义奖励通道(如安全性、地图合规性、速度、加速度)赋予不同权重,进而通过变分推断从离线数据中解析出该偏好,并以其作为条件信号引导生成过程。这种设计既保留了轨迹的真实感,又开启了各自独立的控制轴,让使用者能够灵活操纵某一行为维度而不影响其他维度。

核心方法:从潜在偏好推断到条件生成

CNeVA 的核心思想是将可控行为生成转化为贝叶斯推断问题,并采用变分自编码器式的两阶段训练:先为每条演示轨迹推断出高斯形式的潜在行为变量 λnRK\boldsymbol{\lambda}_n \in \mathbb{R}^K,再训练一个以 λn\boldsymbol{\lambda}_n 为条件的流匹配生成器。

行为潜在变量的变分后验

作者将多智能体场景建模为隐马尔可夫过程,并在每个智能体上附加一个 KK 维的行为剖面 λn\boldsymbol{\lambda}_n。通过引入逐时间步的指数倾斜因子 ψt=exp(γt1λnr(ot,n))\psi_t = \exp(\gamma^{t-1} \boldsymbol{\lambda}_n^\top \boldsymbol{r}(\boldsymbol{o}_{t,n})),整个轨迹的似然贡献简化为 exp(λnGn)\exp(\boldsymbol{\lambda}_n^\top \boldsymbol{G}_n),其中 Gn=tγt1r(ot,n)\boldsymbol{G}_n = \sum_{t} \gamma^{t-1} \boldsymbol{r}(\boldsymbol{o}_{t,n}) 是折扣累积奖励向量。该方法将可解释的行为维度(安全性、地图合规性等)与轨迹证据直接挂钩:λn\boldsymbol{\lambda}_n 的某个分量越大,表示该智能体越重视对应奖励通道。

给定高斯先验 p(λn)=N(μ0,Σ0)p(\boldsymbol{\lambda}_n) = \mathcal{N}(\boldsymbol{\mu}_0, \boldsymbol{\Sigma}_0),利用指数族共轭性质可以直接写出解析后验:

q(λn)=N(μ0+Σ0Gn,Σ0).q^\star(\boldsymbol{\lambda}_n) = \mathcal{N}(\boldsymbol{\mu}_0 + \boldsymbol{\Sigma}_0 \boldsymbol{G}_n, \boldsymbol{\Sigma}_0).

这一闭式解是本文的重要理论贡献。它揭示了 “倾斜—回归” 对偶视角:后验均值由先验均值加上由回报缩水因子控制的回归项构成。回归系数本质上量化了各奖励通道的信噪比——密集的动力学通道(如速度、加速度)具有高信噪比,因此对后验更新贡献大,容易被操控;而稀疏的语义通道(如碰撞、驶出道路)则信噪比低,更新程度弱,更难通过 λ\boldsymbol{\lambda} 独立把控。该预测直接对应了后续实验中不同通道的可控性强弱分级。

为消除不同通道奖励量纲差异带来的优势,作者对原始回报进行通道级标准化,并使用 Σ0=I\boldsymbol{\Sigma}_0 = \boldsymbol{I} 的标准正态先验,使得四个通道的变分标签在条件生成时处于同一尺度。

条件流匹配生成

在标签推断完成后,CNeVA 训练一个条件流匹配模型作为轨迹生成器。生成目标被设为智能体的位移序列,通过线性插值构造噪声潜变量 xs=(1s)yn+sϵ\boldsymbol{x}_s = (1-s)\boldsymbol{y}_n + s\boldsymbol{\epsilon},并训练神经网络速度场 vθ\boldsymbol{v}_{\theta} 去拟合目标 ϵyn\boldsymbol{\epsilon} - \boldsymbol{y}_n。行为潜在变量 λn\boldsymbol{\lambda}_n 通过交叉注意力注入网络,作为额外的条件令牌。

为了实现推理时的无分类器引导(CFG),作者设计了一套精巧的混合通道掩码课程。在训练过程中,随机掩码一部分通道(即令对应分量为零并用掩码标识符告知模型),并以特定比例采样空路径(所有通道均掩码)和部分路径,确保模型见到过单通道条件、多通道条件以及完全无条件的情况。这使得在部署时,用户只需提供针对某一通道的独热偏好 λ=ρek\boldsymbol{\lambda} = \rho \boldsymbol{e}_k,模型就能通过将条件速度场与无条件速度场线性外推,生成可控轨迹:

v~θw=(1+w)vθ(x,λ)wvθ(x,e).\tilde{\boldsymbol{v}}_{\theta}^w = (1+w) \boldsymbol{v}_{\theta}(\boldsymbol{x}, \boldsymbol{\lambda}) - w \boldsymbol{v}_{\theta}(\boldsymbol{x}, \boldsymbol{e}_{\varnothing}).

软资格门与上下文残差回报

针对安全性和地图合规性这类稀疏奖励信号,原始的硬阈值资格门(如碰撞距离小于 5 米才标注)会切断梯度信号,导致大部分安全智能体失去监督。作者引入了软资格门:用指数衰减平滑地调整每步风险权重,使得远离危险的智能体虽贡献微小但仍保持梯度流通。配合上下文残差回报(将场景平均回报减去以剥离场景难度的影响),有效分离了行为风格与环境结构,大幅提升了安全通道的可操控性。

创新点与贡献

本工作有三项核心贡献:

  1. 闭式变分行为标签:首次将变分推断引入交通仿真中的行为偏好建模,提供可解释的 KK 维高斯潜在变量,并通过倾斜—回归分析预测各通道的可控性等级。
  2. 可控性增强要素:上下文残差回报、软资格门及对比条件训练三者协同,将安全通道的可控性从统计不显著提升到稳定正向响应,同时抑制了回报黑客(如通过停车来增加速度奖励)。
  3. 系统性的可控性评估方法论:使用漂移配对的通道操控矩阵(CSM)结合物理合理性护栏(路外率、停滞率、速度留存比),揭示了稀疏奖励通道的可控性高度依赖于奖励定义,警示了独立阅读 CSM 值可能导致的对回报黑客的误判。

实验结果分析

在 Waymo 开放运动数据集(WOMD)上,CNeVA 的 WOSAC 综合真实度指标达到 0.71,处于中等水平,运动学真实度与领先的模仿学习模型可比,碰撞和路外指标受开环误差影响较大。但这并非模型的焦点:其亮点在于在保持此真实度的同时,首次暴露了逐通道的可控性接口

速度与加速度通道展现出一致的单向响应(ΔRspeed=+8.15\Delta R_{\mathrm{speed}}=+8.15, ΔRaccel=+8.76\Delta R_{\mathrm{accel}}=+8.76),且无停滞倾向(速度保有率 94.7%),表明密集动力学通道完全避开了回报黑客。安全性通道在软资格门的加持下,CSM 对角线达到 +0.66+0.66,而硬阈值消融实验的结果仅为 +0.21+0.21 且统计不显著,证明了软资格门的关键作用。地图合规性通道仅在上下文残差回报定义下可控(+0.61+0.61),在物理路外和车道中心线等坐标级回报下几乎无响应,暴露了对回报定义的敏感性。

作者还特别通过停滞率和速度保有量等 “护栏” 指标,展示了早中期消融模型中发生的回报黑客现象:其速度通道 CSM 高达 +51.3+51.3,但停滞率高达 75.9%,速度仅为真值的 61%,说明模型学会了不动以减少速度惩罚(回报变小,即 “提高” 了速度奖励),而这是仅看 CSM 无法察觉的陷阱。CNeVA 的软资格门与上下文残差回报成功避免了这一问题。

实践应用建议与未来方向

对于工程师和研究者而言,CNeVA 提供的通道级解耦控制为自动驾驶仿真测试带来全新可能:

  • 对抗性场景构建:可独立增强安全性倾向,生成更多防御性驾驶场景或激进变道场景,系统化评估规划器的安全边际。
  • 变量隔离分析:同时固定其他轴,仅改变速度倾向,观察规划器对速度变化的敏感性,无需担心行为失真。
  • 离线策略评估:由于 λ\boldsymbol{\lambda} 来自离线数据变分推断,CNeVA 可作为生成模型的先验,为离线强化学习提供风格化的行为先验,减少在线交互成本。

未来工作可沿以下方向展开:首先,针对地图合规性这一结构性局限,设计更丰富的空间-时间分解奖励(如车道内、变道中、路口区域),有望实现坐标级精准控制。其次,将训练过程拓展至闭环微调,并结合对比目标进一步减小开环漂移。最后,更强大的条件机制(如通过自然语言描述直接映射到 λ\boldsymbol{\lambda} 分布)可进一步提升可访问性。

总结与展望

CNeVA 巧妙地将变分贝叶斯推断与流匹配生成相结合,在保持轨迹真实感的前提下,为交通仿真提供了语义清晰、操作便捷的可控性接口。它不仅在技术上通过闭式后验更新和混合课程训练解决了稀疏奖励通道的操控难题,更从方法论层面提出了一套可控性评估标准——将回报响应与物理合理性并行考量,这在生成模型滥用引导信号的当下具有警醒意义。

尽管在地图通道等空间精细控制上仍有提升空间,但 CNeVA 已搭建起一座从纯数据驱动模仿到可解释行为操控的桥梁。随着奖励分解的细化和训练范式的闭环化,这类模型有望成为自动驾驶安全验证链中的关键一环,让仿真环境真正成为可控、透明且可信的测试温床。