TerraZero:面向大规模零演示自博弈的程序化驾驶仿真

arXiv: 2607.13028v1

论文信息

标题: TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale

作者: Zhouchonghao Wu, Akshay Rangesh, Weixin Li, et al.

发布日期: 2026-07-14

arXiv ID: 2607.13028v1

PDF 链接: 下载 PDF

研究背景与动机

自动驾驶系统的安全部署需要处理极其多样且罕见的危险场景,但真实驾驶数据中绝大多数里程都是平淡无奇的跟车、柔和弯道和常规停车。真正决定系统可靠性的长尾场景——如密集的高速公路合流、近距离强行切入、与行人擦肩而过的无保护左转——在日志数据中出现的频率极低。单纯依靠模仿学习或扩大车队规模来覆盖这些分布外场景,成本高昂且效率低下。

仿真提供了系统性地制造这些边缘场景的途径,但现有仿真器在高吞吐量与场景保真度之间始终难以两全。面向性能优化的仿真器(如 PufferDrive)虽快,却只支持单一车辆类型且不含交通信号;功能丰富的环境(如 CARLA、SMARTS)则过于缓慢,无法支撑动辄数十亿步的强化学习(RL)训练。一些基于学习的交通模型(如 SimNet、Trajeglish)能生成逼真的交通流,但多为非反应式的开环模型,难以用于闭环策略提升。自博弈方法(如 Gigaflow)展示了反应式多智能体训练的潜力,但局限于少量合成地图和单一动力学模型,缺乏对真实道路结构和多样化交通参与者的覆盖。

TerraZero 正是为了解决这一矛盾而生:它需要一份速度足以支持大规模 RL 训练、真实度足以反映现实世界地图结构、且多样度足以覆盖长尾场景的仿真器和训练栈。

核心方法:三位一体的技术架构

TerraZero 的核心理念是将高性能对象级仿真程序化场景生成计算高效的自博弈训练配方深度耦合,使得系统能够从零开始,完全依靠强化学习信号,在零人类示范的条件下训练出鲁棒的驾驶策略。

高性能仿真引擎

仿真引擎采用 C 语言编写,运行在 CPU 上,策略推理则在 GPU 上执行,两者通过零拷贝的内存路径交换数据。观测值以 16 位精度打包,主机到设备传输与 CUDA 内核启动相互重叠,并利用 NUMA 感知的 CPU-GPU 亲和性绑定,最大限度地消除序列化开销和带宽瓶颈。这样的设计使得单张服务器级 GPU 即可达到 130 万智能体步/秒(agent-steps/s)的吞吐量,8 卡节点更能扩展至 280 万步/秒,远超同类仿真器,且同时支持异构智能体(车辆、行人、自行车)、多种动力学模型以及完整的交通规则执行。

引擎内部实现了可组合的配置机制:智能体类型、每类动力学、信号控制、规则化道路使用者等六大轴上的选项可以自由组合,从而在一块地图上衍生出几乎无限多的训练场景。交通规则(碰撞、越线、逆行、闯红灯等)被直接嵌入仿真层,违规行为不但带来奖励惩罚,还能触发可配置的后果,如移除违规智能体。

程序化场景生成

TerraZero 不直接在记录数据上训练,而是仅将真实地图几何作为 “种子”,通过层叠的随机化机制制造出大量困难场景。场景的初始化支持日志、随机和混合三种模式。随机模式下,智能体通过拒绝采样放置到车道上,保证无碰撞且目标可达;智能体数量可以超过原始日志中的数量,使场景密度远高于自然记录。目标位置通过拓扑图上的前向游走随机采样,并引入目标丢弃机制,迫使策略不依赖目标信息。

场景中还会注入丰富的规则型非玩家角色(NPC),包括 IDM/PDM 反应式车辆、路缘停放的静态车辆、预定义的事故车群、施工区障碍和行人。行人使用 ORCA 算法在斑马线处穿行或中途乱穿马路;信号控制器有三种可切换模式,其中 “圣诞树控制器” 在每个路口独立随机循环红绿灯,提供极高的相位多样性。这些 NPC 打破了自博弈中单一策略自我对抗的对称性,丰富了交互模式。

鲁棒的自博弈训练配方

训练配方基于 PPO,但针对 “样本廉价、计算昂贵” 的特点做了大量优化。首先,使用显著性优先重放替代均匀采样,优先选择高优势片段进行学习,并通过重要性采样权重纠正偏差。其次,采用 V-trace 离策略修正、PopArt 价值归一化和 GAEs 优势估计,稳定异策略自博弈的优化过程。奖励函数和车辆运动学参数(油门、转向、加速度和速度上限的缩放系数)在每个 episode 开始时会按智能体进行随机化,并使策略以奖励条件化和运动学条件化的观测作为输入,实现推理时的行为可调。

策略网络本身是一个轻量的 MLP(规划器约 350 万参数),将周围道路段、伙伴智能体和交通实体通过 Deep Sets 编码为固定长度的表示。为了打破自博弈中可能退化的对称均衡,TerraZero 采用了群体博弈思想:借助每智能体不同的运动学与奖励随机化,配合场景中规则 NPC 的行为多样性,迫使单一共享策略需要处理分布广泛的交互方式,而无需维护对手池或参考模型。

整个训练流程在纯强化信号下进行,没有使用任何人类演示、模仿损失或记录的轨迹数据。日志数据仅作为地图几何的来源。

主要创新与贡献

TerraZero 的三个核心贡献直接对应其架构的三个支柱:

  1. 高速且功能丰富的仿真引擎:在保持异构智能体、多动力学模型和完全交通规则执行的前提下,实现了迄今最快的对象级驾驶仿真吞吐量,且支持多机分布式训练。

  2. 程序化场景生成器:将日志数据从 “训练分布” 降级为 “起始分布”,通过组合式随机化将每一张真实地图扩展为一个无边界的训练场景空间,覆盖了施工区、事故现场、行人乱穿马路等长尾情境。

  3. 鲁棒的自博弈训练配方:在零人类示范的条件下,通过计算优先策略、群体博弈与非策略修正,训练出同时具备高驾驶性能和高仿真真实度的策略,并展示了零样本跨城市、跨驾驶习惯(右舵/左舵)的泛化能力。

实验结果深度解读

TerraZero 在规划器与仿真智能体两项角色中均接受了严格检验,使用的基准包括 nuPlan val14 和 InterPlan(闭环驾驶性能),以及 Waymo Open Sim Agents Challenge (WOSAC)(交通仿真真实度)。

常规驾驶基准 val14 上,TerraZero 得分 92.27,在强化学习方法中位列第二,仅次于 Gigaflow,但与顶尖的规则型规划器 SPDM 几乎持平。关键的是,它在无过错碰撞(99.11)和碰撞时间(TTC,96.06)两项安全指标上排名第一,证明了其安全性优先的特性。这一成绩是在完全没有依赖手工规则或复杂路由地图的情况下取得的,使用的观测表示远简于 Gigaflow。

在专门测试长尾分布场景的 InterPlan 基准上,TerraZero 以 67.87 分大幅领先所有已有方法(包括基于大型语言模型的混合规划器),成为首个完全由学习获得且登顶该基准的策略。与之对比,规则型规划器 SPDM 为了在 InterPlan 上达到 63.66 分,必须以牺牲 val14 表现为代价(扩大提案预算至 60),而 TerraZero 的单一检查点可在两个基准上同时保持顶尖水平。这一结果直接验证了程序化长尾场景生成的有效性:策略已在训练中密集遭遇过锥桶、事故车群和违规行人等情境。

WOSAC 仿真智能体真实度评估中,TerraZero 的异构策略(同时控制车辆、行人、自行车)在 2023 版协议下超越了 Gigaflow(真实度 0.632 vs 0.619),且 Gigaflow 对行人采用了脚本控制器。2024 版协议下,TerraZero 与最强的自博弈方法 SPACeR 持平(车辆真实度 0.740 vs 0.741),而 SPACeR 依赖一个在日志数据上预训练的参考模型进行锚定,TerraZero 则完全没有使用任何日志数据初始化或参考策略。在脆弱道路使用者(VRU)仿真上,TerraZero 也明显优于其他无示范方法,且碰撞率和离道率在所有方法中最低。

泛化实验揭示了更深刻的性质:无论策略是在 Waymo、nuPlan 还是仅五个合成 CARLA 小镇上训练,跨数据集评估的车辆真实度和安全分数几乎不变,差距极小。更令人惊讶的是,仅在右舵交通数据上训练的策略,在左舵的新加坡场景中取得了与混合训练相当的表现,表明策略学会了遵循车道局部拓扑而非记忆固定行驶方向。这种稳健性归因于运动学域随机化和奖励条件训练的共同作用。

实践应用建议

对于从事自动驾驶仿真与决策智能体研发的团队,TerraZero 的设计哲学提供了重要启示:

  • 以计算效率换取样本效率:当仿真足够快时,应优先利用高回收价值样本,结合离策略修正,避免在大量平凡的稳态数据上浪费梯度更新。
  • 程序化多样性优于数据规模:通过可控的随机化机制制造需要的硬场景,比单纯扩大真实日志更有助于覆盖长尾。即使地图有限,合理的随机化组合也能产生足够的训练广度。
  • 打破对称性需多层次随机化:自博弈训练中,仅使用运动学噪声不够,还应引入异质智能体类型、规则型 NPC 和可变的交通控制逻辑,防止策略收敛到脆弱的单一模式。
  • 观测与奖励的条件化:让策略感知当前随机化的系数,可在不重新训练的情况下微调驾驶风格(如更保守或更高效),便于部署时适配不同运营设计域。
  • 仿真真实度应从交互闭环考察:一个同时通过安全驾驶基准和交通仿真真实度基准的策略,才能表明它既不会为了安全而过度保守,也不会为了逼真而忽视碰撞风险。

未来发展方向

论文中坦承了当前系统的局限,也指出了扩展路径。城市级仿真可将训练场景从单路口片段延伸至大范围路网,支持长时域规划。更多智能体类型(如应急车辆、施工机械、电动滑板车)的加入将进一步完善交互生态。仿真到真实(Sim-to-Real)迁移实验是验证域随机化效果的必经之路,需要将训练好的策略部署到真实车辆。此外,与视觉感知流水线的集成将使 TerraZero 从对象级世界过渡到端到端驾驶系统,例如用感知网络提取的特征取代真值结构化观测,从而统一训练感知与控制。

总结与展望

TerraZero 证明了一个以零人类示范、纯强化学习驱动的仿真器-训练栈,能够同时培养出在常规驾驶中安全可靠、在长尾危险场景中坚韧不拔、在交通建模中高度逼真的驾驶智能。它打破了过去 “快而简陋” 与 “慢而完备” 之间的僵局,通过程序化生成和计算高效的自博弈食谱,让大规模自博弈真正扎根于真实道路拓扑之上。这一工作不仅为自动驾驶的仿真训练设立了新的工程基线,也为通用智能体在复杂物理世界中的自主学习提供了可参照的范式。随着将对象级仿真与感知、规划全栈系统进一步整合,我们有望看到更安全、更泛化的自动驾驶人工智能在无人工标注的循环中自我进化。