NavTrust:具身导航可信度基准测试
NavTrust: Benchmarking Trustworthiness for Embodied Navigation
论文信息
标题: NavTrust: Benchmarking Trustworthiness for Embodied Navigation
作者: Huaide Jiang, Yash Chaudhary, Yuping Wang, et al.
发布日期: 2026-03-19
arXiv ID: 2603.19229v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:该论文针对具身导航(包含视觉语言导航 VLN 与物体目标导航 OGN)在真实场景中的可信度评估空白,系统研究 RGB‑D 感知和语言指令受到真实扰动时,主流导航模型的鲁棒性退化情况。
- 核心方法:论文构建了首个统一可信度基准 NavTrust,引入系统性损坏(RGB 图像、深度传感器、指令)并测试七个前沿模型;同时比较四种鲁棒性增强策略(数据增强、知识蒸馏、适配器、安全 LLM),并在真实机器人上验证。
- 关键结果:仅视觉模型在低光加噪声下成功率平均下降约 29%(见 RGB 图像损坏分析);深度辅助模型在 RGB 损坏中更坚韧,但深度损坏下成功率可能从 50% 暴跌至 0%(深度损坏部分);经数据增强后,ETPNav 在 RGB 和深度损坏下的 PRS‑SR 分别提升至 0.94 和 0.75(表 2)。
- 主要局限:基准目前专注于感知鲁棒性,未全面考虑运动动态、标定误差等几何故障;面向白盒的指令攻击仅针对部分模型;RGB 适配器因编码器不兼容无法有效训练;真实世界测试仅覆盖两个模型。
- 适合读者:具身 AI、机器人导航、多模态模型鲁棒性领域的研究者与工程师;关注 VLN/OGN 系统在感知和语言层面脆弱性的从业者。
论文背景和研究动机
具身导航在复杂室内环境中依赖两大任务范式:视觉‑语言导航(VLN,通过自然语言指令导航)和物体目标导航(OGN,寻找指定物体)。尽管端到端深度学习模型已取得显著进步,但现有评测大多在 “理想输入” 下进行,忽略了真实部署中必然出现的感知退化和语言扰动。例如,轻微的语义改写可让 VLN 成功率下降 25%,弱光或运动模糊会使 OGN 性能急剧下滑,而深度传感器损坏往往被彻底忽视。当前基准缺少统一框架来系统评估多模态可信度,更缺乏有针对性的鲁棒性增强对比。
为了弥合这一鸿沟,论文提出了 NavTrust。它首次在同一基准内统一评估 VLN 与 OGN 的可信度,不仅涵盖八种 RGB 损坏(如运动模糊、弱光、溅射、闪烁、黑帧等),还引入四种深度损坏(高斯噪声、数据缺失、多径干扰、量化),并对指令施加五种扰动(风格改写、大写强调、掩码、黑盒/白盒对抗提示)。在此基础上,论文围绕诊断出的脆弱性,头对头比较了四种增强策略,并在真实移动机器人上验证了趋势的可迁移性。
核心方法和技术细节
NavTrust 以 Habitat‑Matterport3D 数据集为基地,将 OGN 与 VLN 的起点、目标对齐,确保空间条件一致。评测涵盖 7 个前沿模型:VLN 的 ETPNav、NaVid‑7B、Uni‑NaVid,以及 OGN 的 WMNav、L3MVN、PSL 和 VLFM。
损坏体系设计与强度控制:
- RGB 图像损坏:包括运动模糊(模拟快速移动)、弱光(带或不带传感器噪声)、溅射(污染)、闪烁(强光源)、散焦、异物遮挡、黑帧。强度系数 用于形成明显但非极端的退化(参考 ImageNet‑C 风格)。
- 深度损坏:高斯噪声(模拟传感器抖动)、数据缺失(反射/透明表面造成空洞)、多径干扰(ToF 传感器在边角处过估计)、量化(降低深度分辨率)。这四种损坏直接针对地图构建与规划的关键几何输入。
- 指令损坏:多样性改写(友善/新手/专业/正式四种风格)、大写关键词、随机掩码非必要词(50%‑100% 比例)、黑盒恶意前缀(语义干扰),以及白盒系统提示注入。白盒攻击只对 NaVid 和 Uni‑NaVid 这类显式使用系统提示的模型有效。
评估指标上,论文采用成功率(SR)、按成功加权路径长度(SPL)以及性能保留分数(PRS)来量化损坏下性能退化。PRS 定义为损坏后指标相对清洁指标的平均比例,1 代表完全鲁棒,0 代表彻底失效。
四种缓解策略分别为:
- 感知损坏数据增强:分逐帧增强、跨整条轨迹的逐段落增强、按难易分布加权增强;强度可调至 0.9/0.8,以训练 ETPNav 的抗干扰能力。
- 教师‑学生蒸馏:用增强训练后的教师模型指导学生模型学习干净拓扑表征,优化目标是模仿学习、策略 KL 散度与特征均方误差的组合。
- 轻量适配器:在深度和 RGB 路径插入残差瓶颈模块,只训练约 4% 的参数,并利用基于视角可靠性加权的全景融合抑制异常值。
- 安全 LLM:微调量化 LLaMA‑3.2 将指令标准化为 RxR 风格,或使用 OpenAI o3 做提示工程改写,去除对抗内容和句法偏移,且不改变任务意图。
创新点和贡献
- 首次统一基准:NavTrust 将 VLN 与 OGN 的可信度评估首次置于同一框架下,同时引入此前被忽视的深度传感器损坏,补齐了已有工作(如 RobustNav)只关注 RGB 的短板。
- 标准化协议与开放资源:论文承诺公开标准化评估协议和损坏套件,为社区提供可复现的可信度测试手段。
- 系统性脆弱性诊断:对七种 SOTA 模型进行了全面剖析,揭示深度早期融合(如 ETPNav)虽对抗 RGB 损坏有优势,但易遭深度噪声毁灭性破坏;视觉‑语言预训练(如 BLIP‑2)天然比检测器流水线更耐视觉扰动;指令掩码超过 50% 时几乎所有 VLN 模型性能将向随机游走溃退;跨语言切换(印地语/泰卢固语)使无多语言训练的 Uni‑NaVid 成功率暴跌至个位数(图 5)。
- 策略对比与迁移验证:头对头比较四种增强方案,并通过真实机器人实验表明,模拟中观察到的趋势(深度辅助模型抗黑帧能力更强、指令标准化能恢复失败案例)可迁移至物理世界(图 7、8)。
实验结果分析
感知损坏下的表现与模型差异
从图 3 的 PRS 柱状图和具体数值可以看出,仅视觉模型(NaVid、Uni‑NaVid、PSL)在低光+噪声等恶化下平均成功率下降约 29%,而深度辅助模型(ETPNav、L3MVN)降幅减小;VLFM 的 PRS‑SR 达到 0.94,在所有 RGB 损坏中几乎不受影响。这得益于其分离几何与语义的模块设计以及 BLIP‑2 的高层语义先验。但深度损坏暴露了另一面:高斯噪声使 L3MVN 成功率从 50% 崩至 2%,VLFM 从 50% 降至 0%,而 ETPNav(RxR)仅从 56% 降至 53%。WMNav 通过置信度门控晚融合表现出对深度噪声较好的耐受(PRS‑SR 0.87)。量化噪音对直接摄入原始深度的 ETPNav 仍有较大冲击(R2R 成功率从 65% 降至 48%),显示原始深度编码不够鲁棒。总而言之,早期的原始深度合并会放大传感器误差;晚融合与不确定性管理是提升深度鲁棒性的关键。
指令损坏的脆弱性图谱
风格改写对 ETPNav 影响最甚:新手与专业风格下成功率下降 33‑40%,而 NaVid 和 Uni‑NaVid 下降相对较小(13‑27%,RxR),表明 ETPNav 的固定令牌化器在遇到词汇外术语或简并语法时极易丢失语义。掩码测试表明全掩码后所有模型趋近随机。对抗提示注入可造成 10‑30% 的成功率下滑,白盒攻击通过篡改系统提示甚至能完全瘫痪目标模型。多语言测试中,仅用英文训练的 Uni‑NaVid 遇上印地语/泰卢固语时成功率仅剩约 12%,而明确接受多语言训练的 ETPNav 保持 54‑60% 的成功率(图 5)。这些结果凸显了训练语料的多样性与分词器的灵活性是语言鲁棒性的根基。
缓解策略的效果对比
以 ETPNav 为对象(表 2),逐帧数据增强的 PRS‑SR 在 RGB 和深度上分别为 0.89 和 0.67,而保持时间一致性的逐段落增强将该值提至 0.92 和 0.72,充分说明拓扑规划中时序连贯的重要性。按难度分布加权后 RGB PRS‑SR 进一步提升至 0.93,深度至 0.73;将强度提升至 0.9/0.8 后 PRS‑SR 达到 0.94 和 0.75。教师‑学生蒸馏对深度损坏贡献最大,PRS‑SR 跃升至 0.85,证明了结构化策略迁移比单纯数据扩增更有效地将鲁棒推理注入学生模型。适配器用极少量参数将 PRS‑SR 从 0.62 大幅拉升到 0.89,对深度误差尤为有效,展现出在已有骨干上低成本修正的巨大潜力。在指令侧,经过安全 LLM 微调后,三模型平均 PRS‑SR 提高 0.14‑0.32(图 6),其中微调 LLaMA‑3.2 擅长剥离对抗内容,而 o3 更适合风格归一化。
实践建议
基于 NavTrust 揭示的规律与缓解效果,可提炼出若干可直接落地的工程设计原则:
-
构建分层融合架构,并加入不确定性门控 直接把原始深度馈入 Transformer 会放大传感器噪声。应采用先提取单目特征、再以置信度门控将深度作为辅助通道的方式,正如 WMNav 的策略。在深度损坏严重的场景下,这样的晚融合可大幅减少失败。
-
对抗性多模态数据增强需保留时间一致性 在 VLN/OGN 训练中应优先采用逐段落增强而非逐帧随机增强,维持时空连续性。此外,可动态提升历史上表现较差的损坏类型的采样概率,以在有限训练资源下获得更大鲁棒性收益(见表 2 分布式增强的效果)。
-
为模型接入轻量适配器实现低成本鲁棒性升级 冻结骨干网络,在感知路径插入残差卷积适配器,只需训练不足 5% 的参数就能将深度与 RGB 融合的鲁棒性极大提高。该方案尤其适用于已部署模型,可快速响应传感器老化或部署环境变化。
-
前置指令标准化模块 在 VLN 系统流水线前端部署一个小型安全 LLM(如微调后的 8‑bit LLaMA‑3.2),对用户指令进行去毒化和风格归一化,转换成模型训练中熟悉的表述(如 RxR 风格)。在真实机器人实验中,这一步骤使因对抗提示或行话改写导致的导航失败完全恢复(图 7、8),且推理开销微小。
-
拓展训练数据的语言和风格覆盖 多语言测试结果警示:仅英文或单一风格训练的 VLM 导航器会因简单的语种切换而崩溃。建议在指令数据集中加入方言、多语种和多样化改写,同时使用课程学习逐步增加掩码比例和语法复杂度,以提升分词器对词汇外短语的容忍度。
以上手段可在不改变主体导航架构的条件下,显著增强具身导航系统在真实非受控环境中的可信度。NavTrust 提供的系统性诊断范式也可作为迭代开发中的回归测试套件,帮助团队持续跟踪模型鲁棒性的变化。