TerraZero:面向大规模零示范自我博弈的程序化驾驶仿真
TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale
论文信息
标题: TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale
作者: Zhouchonghao Wu, Akshay Rangesh, Weixin Li, et al.
发布日期: 2026-07-14
arXiv ID: 2607.13028v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题: 如何构建一个足够快的仿真器,在支持大规模强化学习的同时,还能生成足够多样、包含真实世界地图结构与长尾安全场景的驾驶情景,并让智能体从零开始自我博弈,完全不依赖人类示范数据。
- 核心方法: 设计了一个 C 语言实现的对象级驾驶仿真引擎(TerraZero),结合程序化场景生成和分布式近端策略优化(PPO),将真实地图仅作为几何骨架,通过随机初始化、规则化非玩家角色(NPC)和多维域随机化,为每张地图构造近乎无限的训练场景。
- 关键结果: 在 InterPlan 长尾场景基准测试中,TerraZero 以 67.87 分(满分 100)位列所有方法之首,是第一个完全靠自博弈学习达到该成绩的规划器,同时它也是 nuPlan val14 上最安全的方案,无责碰撞与碰撞时间指标均为最佳(表 2、表 3)。
- 主要局限: 系统依赖高精地图,无法使用缺失此类地图的区域;仿真为对象级抽象,不包含视觉感知,无法直接训练端到端感知-控制流水线;动力学域随机化未能完全弥合 sim-to-real 的物理鸿沟(见论文结论部分)。
- 适合读者: 从事自动驾驶仿真、强化学习、多智能体系统以及希望在资源受限条件下实现大规模自博弈训练的研究人员和工程师。
论文背景和研究动机
现实路采数据中绝大部分是平淡无奇的跟车、缓弯和常规停走,而真正决定部署能力的长尾安全场景(如密集并道、突然切入、行人横穿、无保护左转)极为稀少。基于记录轨迹的模仿学习很难教会智能体应对这些罕见情景,且通过扩大车队收集更多数据也只能缓慢缩小分布差距。因此,仿真成为关键补充手段——它可以系统性地制造那些真正重要的危险场景。
然而,现有的驾驶仿真器始终无法同时解决速度与真实度的矛盾。像 CARLA、SMARTS 这样的环境虽然具备丰富的特征,但运行速度太慢,无法支撑从头开始的强化学习训练(通常需要数十亿步交互);而像 PufferDrive、GPUDrive 等追求吞吐量的对象级仿真器则只支持单一智能体类型、固定动力学且无交通信号,无法覆盖长尾场景。另一类工作(SimNet、Trajeglish 等)通过从日志中学习交通模型来生成逼真轨迹,但这类模型大多不具备对自车决策的反应性,难以用于闭环策略提升。自我博弈方法(如 Gigaflow)利用反应式多智能体训练获得鲁棒策略,但其训练局限于少量合成地图与统一的动力学模型,缺乏结构化长尾场景的生成能力。
TerraZero 正是在这种背景下提出的,它试图通过程序化场景生成和零人类示范的自博弈配方,在一个足够快且足够复杂的仿真平台上,同时解决训练多样性与策略鲁棒性的问题。
核心方法和技术细节
TerraZero 由三个支柱构成:一个快速的 C 语言对象级仿真引擎、一个程序化场景生成器,以及一个面向计算效率的自博弈训练配方。
高性能仿真引擎
仿真求解完全用 C 实现并编译为 Python 扩展,策略推断与学习则运行在 GPU 侧。两者通过零拷贝内存实现数据交换:C 引擎将观测直接写入与 PyTorch tensor 共享的缓冲区,免去了每步的序列化与内存分配开销;观测采用 16 位精度以减半传输带宽,并且进程亲和性绑定到 GPU 所在 NUMA 节点的 CPU 核上。该设计使得在单块服务器级 GPU 上可持续达到 130 万智能体步/秒 的吞吐量,8 块 GPU 节点上可达 280 万步/秒,远超现有同类系统(见表 1)。
引擎支持异构智能体(汽车、行人、自行车),每种类型各自使用不同的动力学模型:汽车为带有加加速度控制的自行车模型,卡车增加了轮胎侧偏力,行人使用独轮车模型。交通规则(碰撞、驶离道路、逆行、红绿灯、停车标志)直接内嵌于仿真层,违规会产生惩罚并影响评估指标。交通信号由三种可配置控制器驱动(NEMA 双环标准、圣诞树随机控制器、轮转控制器),且每回合可随机化相位与左转保护方式。
程序化场景生成
TerraZero 将路采数据仅当作地图几何的来源,而非训练轨迹的来源。在随机初始化模式下,智能体会被按类别(汽车、行人等)分别放置到车道网络上,通过拒绝采样确保无碰撞且符合交通规则;智能体的数量上限可超过原始日志,从而生成比真实记录更密集的交通流。每个智能体的包围盒尺寸、动力学系数、奖励权重都会在每回合采样,形成连续变化的空间。导航目标通过车道拓扑图上的随机前向游走生成,并配有目标丢弃机制,迫使策略在没有明确终点指示时依然遵循道路结构。
为了打破自我博弈中的对称性,场景中还会注入规则化非玩家角色(NPC),包括:基于智能驾驶员模型(IDM)的激进/保守反应车辆、可随机重设风格的规划器驱动车辆、沿街停靠的车辆、预制的事故车辆簇(连环追尾、T 型碰撞等)、施工锥桶区域,以及由 ORCA 算法控制的行人(可穿越人行横道或随机横穿马路)。这些生成器的组合可以按配置开关,使得一张真实地图衍生出数量近乎无限的训练变体(见图 4)。
自博弈训练配方
训练采用 PPO,但强调计算效率而非样本效率:由于仿真很快,系统通过基于优势绝对值的优先级采样,按比例重放高价值片段并忽略近零片段,并用重要性采样修正偏差。价值估计采用了 V-trace 离策略修正(处理 rollout 与更新间的策略滞后)和 PopArt 归一化(应对不同场景间回报量级的剧烈变化)。这些稳定化机制与奖励/动力学域随机化、多类 NPC 共存的人口博弈共同作用,使策略在没有人类示范、没有模仿损失、完全依赖奖励信号的情况下学会鲁棒驾驶。
创新点和贡献
- 快速且特征完整的对象级仿真器:将 C 引擎的 CPU 仿真与 GPU 策略推断无缝衔接,在保留异构智能体、多种动力学和全交通规则的前提下,实现了显著领先的吞吐量(图 5、表 1)。
- 程序化场景生成:提出将真实日志仅作为种子数据,通过可组合的随机化手段制造长尾训练场景,使得策略能够训练于高度多样化的对抗性交通环境中,而非局限于日志分布。
- 零示范的自博弈配方:完全不用人类驾驶数据,仅凭强化学习信号训练出既能作为安全规划器(在 InterPlan 长尾测试和 val14 例常驾驶中均表现优异),又能作为逼真仿真智能体(在 Waymo Open Sim Agents Challenge 中胜出同类方法)的统一策略。
实验结果分析
在 nuPlan val14 闭环反应式基准上,TerraZero 取得了 92.27 的综合分,虽略低于 Gigaflow 的 93.8,但在无责碰撞(99.11)和碰撞时间(96.06) 两个安全指标上排名第一,显示出极致的安全导向(见表 2)。而在专门考验长尾能力的 InterPlan 基准(80 场景集)上,TerraZero 以 67.87 分达到第一,领先最强对手 SPDM(63.66)超过 4 分,且仅靠一个 checkpoint 无需任何人工规则或语言模型(见表 3),这归因于其训练时大量接触施工区、事故现场、横穿行人等长尾场景。
在 Waymo Open Sim Agents Challenge(WOSAC)的仿真智能体现实中,TerraZero 在 2023 年协议下以 0.632 的综合实现实度超过了 Gigaflow 的 0.619,2024 年协议下以 0.740 车辆实现实度 与 SPACeR 持平,且完全不使用演示数据或参考策略(见表 4、表 5)。值得注意的是,同一策略还能零样本迁移至完全不同城市的左行交通(新加坡),其驾驶行为自动遵循当地车道方向,未出现崩溃,展示了域随机化和奖励条件化带来的泛化能力(图 6)。
实践建议
TerraZero 框架非常适合希望以低成本批量生成长尾驾驶场景并训练鲁棒策略的团队。实践时可按以下思路进行:
- 快速生成对抗性训练集:利用提供的程序化生成器,从已有的高精地图(Waymo、nuPlan、CARLA 等)出发,直接生成包含随机车流密度、不规则横穿行人和事故车簇的多样化场景。无需额外采集数据即可扩充训练集。
- 实施无监督自博弈训练:对于不想依赖昂贵专家示范的应用,TerraZero 的配方展示了完全由奖励函数驱动、从零开始学习驾驶的可行性。可参考其奖励归一化、优先采样和 V-trace 组合,在自定义的动力学和交通规则下稳定训练。
- 通过奖励向量调节驾驶风格:策略网络接收采样后的奖励权重作为观测条件,因此在部署时可通过调整权重(如提高舒适性惩罚、降低速度偏好)改变驾驶行为,而无需重新训练。这对需要适配不同运营设计域(ODD)的场景十分有用。
- 跨城市场景零样本迁移:由于场景生成与地图几何解耦,策略天然具备跨城市甚至左右行切换的能力。可将主要训练放在路采数据丰富的城市,然后直接迁移到目标城市评估,减少重复采集与标注的成本。
需要注意的是,当前系统仍依赖高精地图,若目标场景缺乏此类地图,需结合实时建图等方案提供道路拓扑。此外,对象级仿真无法覆盖视觉感知的不确定性,若与端到端系统结合,可考虑将 TerraZero 生成的轨迹作为规划真值,用于蒸馏或作为世界模型的后端。