Drive My Way:面向个性化驾驶的视觉-语言-动作模型偏好对齐

Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving

arXiv: 2603.25740v1

论文信息

标题: Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving

作者: Zehao Wang, Huaide Jiang, Shuaiwu Dong, et al.

发布日期: 2026-03-26

arXiv ID: 2603.25740v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现有端到端自动驾驶系统只优化通用目标或提供固定驾驶模式,无法适应个体驾驶偏好,也无法理解自然语言指令(如 “我累了”“我快迟到了”)。
  • 核心方法:提出 DMW,一个个性化的视觉-语言-动作(VLA)框架,通过对比学习从驾驶员档案中提取长期偏好嵌入,并通过强化微调实现实时自然语言指令的风格自适应。
  • 关键结果:在 Bench2Drive 闭环评测中,DMW 在不同风格指令下实现明显的行为区分:保守指令时舒适度大幅提升至 34.62(对比 SimLingo 的 26.99),激进指令时效率达到 281.56(对比 SimLingo 的 247.60)(表 1)。
  • 主要局限:方法仅限 CARLA 仿真器内验证,尚未在真实车辆上部署(见论文结论部分)。
  • 适合读者:从事自动驾驶、人机交互、强化学习与基础模型交叉研究的工程师和研究人员,尤其是关注个性化和安全对齐的读者。

论文背景和研究动机

人类驾驶行为本质上是个人化的。每个人的加速、制动、变道、让行和超车方式都不同,这些差异源于长期习惯和短期意图的交互影响。然而,主流端到端自动驾驶系统要么针对通用安全与效率目标优化,要么只提供几种预设模式(如 “运动”“舒适”“节能”),无法捕捉细微且不断变化的乘客偏好。更关键的是,这类固定模式无法解释自然语言指令,例如 “我有点累” 或 “我上班要迟到了”。

近年来,个性化自动驾驶的研究主要有两条路线。一是数据驱动方法,通过行为克隆或逆强化学习从人类示范中提取预定义的驾驶风格,但这类方法需要大规模多样化数据集,且难以扩展到偏好高度异质的用户群体。二是语言驱动方法,利用大语言模型(LLM)如 GPT-4 来解释乘客指令并生成高层驾驶决策,但现有工作在复杂动态场景(如紧急制动、匝道汇入)中尚未进行系统验证。

论文指出,实现 “长期、上下文自适应的个性化” 是提升用户信任和满意度的关键。为此,作者提出了 DMW —— 一个同时整合视觉观测、用户画像和实时自然语言指令的 VLA 框架,能够在保持安全的前提下生成符合个体偏好的驾驶动作。

核心方法和技术细节

DMW 由三个关键部分构成:VLA 基座模型、长期偏好学习与对齐,以及短期指令自适应。

VLA 基座

DMW 采用 SimLingo 作为 VLA 骨干。SimLingo 基于 InternVL2-1B 架构,整合 InternViT-300M-448px 视觉编码器和 Qwen2-0.5B 语言模型。该模型在 PDM-Lite 专家示范和辅助推理信号的监督下,预测时序和几何路径点,并转换为目标速度和转向指令。

长期偏好学习

为了对不同驾驶者的底层风格建模并让 VLA 与个性化偏好对齐,论文引入了一个长期偏好编码器,通过对比学习机制学习用户嵌入。

偏好编码器 fp(⋅)f_p(\cdot) 接受驾驶者 mm 的画像 PmP^m 作为输入,使用 DeBERTaV3 文本处理器和一个投影头输出用户嵌入 zpmz_p^m。同时,路线处理器 fb(⋅)f_b(\cdot) 处理驾驶者的历史轨迹窗口(包含前视图像、自车状态和动作序列),输出行为嵌入 zb,tmz_{b,t}^m,用于概括驾驶者的实际驾驶倾向。

论文使用 InfoNCE 对比损失函数来对齐两种嵌入:使同一驾驶者的 zpmz_p^m 和 zb,tmz_{b,t}^m 在隐空间中接近,同时将不同驾驶者的嵌入推开。

Ltm=−log⁡exp⁡(sim(zpm,zb,tm)/τ)∑j=1Mexp⁡(sim(zpj,zb,tm)/τ)\mathcal{L}_t^m = -\log\frac{\exp(\mathrm{sim}(z_p^m, z_{b,t}^m)/\tau)}{\sum_{j=1}^M \exp(\mathrm{sim}(z_p^j, z_{b,t}^m)/\tau)}

获得了用户嵌入后,DMW 在规划阶段将策略以该嵌入为条件,并通过强化微调进一步适配。为了增强行为多样性,论文在训练时对轨迹做增强——将策略同时以目标驾驶者 mm 和与之最不相似的驾驶者 uu 的嵌入为条件,并根据路线级动作统计量对原始动作进行缩放,得到增强动作 a~tm\tilde{a}_t^m。奖励函数衡量模型输出动作与参考动作(或增强动作)的行为相似性,鼓励策略对不同用户嵌入产生差异化的决策。

短期指令自适应与风格感知奖励

论文为 20 个驾驶场景构建了风格指令集。每个场景有 9 条风格化指令,覆盖从保守到激进的 3 种驾驶风格,每种风格以 3 种不同直接程度表达(遵循 Talk2Drive 中的隐含度定义)。

为实现指令驱动的行为自适应,DMW 设计了一个风格感知的奖励函数,将安全、效率、舒适目标动态组合:

R(st,at)=ws⋅Rsafety+we⋅Refficiency+wc⋅Rcomfort\mathcal{R}(s_t, a_t) = w_s \cdot R_{\text{safety}} + w_e \cdot R_{\text{efficiency}} + w_c \cdot R_{\text{comfort}}

其中安全奖励基于碰撞时间(TTC),效率奖励鼓励维持与风格偏好一致的速度,舒适奖励评估转向和加速度是否在平顺性阈值内。论文采用多阶段方法生成奖励参数:先用 GPT-5 根据场景描述和指令推断奖励权重和阈值,再经专家审核精化,确保最终奖励函数既反映指令语义,又保持安全驾驶行为。

创新点和贡献

DMW 的主要贡献可归纳为以下三点:

第一,提出了首个同时对齐长期驾驶偏好和短期语言指令的端到端 VLA 个性化驾驶框架。 不同于以往工作仅关注某一维度,DMW 将用户嵌入和风格指令统一纳入决策过程,使车辆既能体现驾驶者固有的行为特征,又能根据实时语境调整策略。

第二,构建了首个多模态个性化驾驶数据集(PDD)。 该数据集涵盖 30 名真实驾驶者在 CARLA 仿真器中穿越 20 个多样化交通场景的数据,包含驾驶画像、轨迹和特权信息。与依赖合成指令—动作对或粗略风格标签的现有数据集不同,PDD 记录了复杂实时交互中的人类驾驶行为,为研究个体决策差异提供了宝贵基础。

第三,提出风格感知的奖励自适应机制。 通过 LLM 推理与专家审核相结合的方式,论文将抽象的自然语言指令映射为具体的奖励函数参数(权重、TTC 阈值、偏好速度、舒适阈值),实现了从语言语义到驾驶行为的精准衔接。

实验结果分析

论文在 Bench2Drive 闭环基准上进行了全面评估,同时辅以个性化指标和用户研究。

长期偏好对齐(用户研究)

论文引入对齐分数(AS),先将所有驾驶者根据历史日志聚类,再计算模型生成的轨迹被正确归类到目标簇的准确率。同时邀请 10 名评估者对模型轨迹与真实驾驶者日志的相似度进行 1-10 评分。结果显示,DMW 在分布内(ID)和分布外(OOD)驾驶者上的 AS 分别为 0.92 和 0.83,显著优于 MORL-PD 基线(ID: 0.42-0.58, OOD: 0.25-0.33)(表 3)。评估者评分也呈现一致趋势(DMW: 8.7-8.0,MORL-PD: 5.1-3.5)(表 3),表明外部观察者能可靠识别出模型行为与对应驾驶者习惯的一致性。

短期指令自适应(Bench2Drive)

在保守指令下,DMW 实现最高驾驶分(DS)82.72 和成功率(SR)71.56,舒适度达到 34.62,同时保持较低速度 6.18 m/s 和较大车距 30.05 m。在激进指令下,效率跃升至 281.56,速度达 7.72 m/s,但舒适度降至 21.62。相比之下,SimLingo 在激进与保守指令间的效率差异仅为 8.83,StyleDrive 为 14.53,而 DMW 达到 44.50(表 1),凸显了 DMW 在风格自适应上的明显优势。

消融实验

消融实验验证了两个关键设计。其一,自适应平均池化(AAP)模块对表达用户嵌入至关重要。去除 AAP 后,不同驾驶者的行为指标差异缩小,AS 显著下降(例如 D1 无 AAP 时 AS=0.67,有 AAP 时 AS=0.92)(表 4)。其二,风格感知奖励权重对行为区分度影响巨大。当采用固定权重(DMW-Vanilla)时,激进和保守指令下的驾驶行为区分度明显减弱,效率差异仅为 6.30,远低于 DMW 的 44.50(表 1),证实了动态调整奖励权重的重要性。

实践建议

对于希望在个性化自动驾驶领域落地的团队,本论文提供了以下可参考的实践路径:

构建个性化驾驶数据基础设施:论文构建 PDD 的方法(30 名驾驶者 × 20 场景 × 多模态采集)可作为数据采集环节的参考模板。在真实部署前,可先复用类似的仿真-问卷-驾驶记录流程,获取高质量行为数据。

分层实现偏好对齐:DMW 采用 “长期嵌入 + 短期指令” 的双层架构值得借鉴。长期层通过对比学习从用户画像和驾驶日志中提取稳定偏好,短期层通过语言指令和动态奖励实现即时调整。在工程落地时,可将长期嵌入作为 “驾驶者指纹” 预先训练并缓存,在线推理时仅需输入画像即可快速切换个性化风格。

风格感知奖励的工程化:论文使用 LLM + 人工审核生成奖励参数的方法具有可操作性。实践中,可先将常见驾驶指令映射至安全/效率/舒适的权重、速度阈值和 TTC 容忍度,经专家校验后形成参数库,降低在线推理的计算开销。需要注意的是,当前方法仅在仿真器中验证,真实道路部署仍需解决传感器噪声、极端工况泛化和安全边界等问题。