DreamFly:面向空中视觉语言导航的因果记忆与滚动时域扩散规划

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

arXiv: 2608.12308v1

论文信息

标题: DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

作者: Yan Deng, Fei Xu

发布日期: 2026-08-12

arXiv ID: 2608.12308v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决空中视觉语言导航(Aerial VLN)中历史上下文、多步动作规划与终止判断难以在统一闭环中被可靠建模的问题。
  • 核心方法:作者提出 DreamFly,在 Dream-VLA 扩散骨干上引入因果对齐历史记忆、K 步动作块 “规划 K 步只执行一步” 的滚动时域扩散规划,以及解耦的 LiteStop 终止模块。
  • 关键结果:在 OpenFly 基准的 test-seen/test-unseen 上,DreamFly 分别取得 32.04%/29.46% SR 和 28.22%/23.54% SPL,且导航误差最低(见论文表 2)。
  • 主要局限:当前评估只限于仿真环境,尚未在真实无人机平台上验证噪声、扰动与 sim-to-real 迁移能力(见论文第 5 节)。
  • 适合读者:从事视觉语言导航、具身智能、VLA 模型、扩散策略或无人机自主导航研究与实践的读者。

论文背景和研究动机

视觉语言导航要求智能体根据自然语言指令,在连续观测中做出序列决策并最终到达目标。空中视觉语言导航进一步将任务扩展到三维无人机平台,智能体需要同时协调水平位移、垂直运动和视角调整。论文指出,空中环境规模大、遮挡多,单帧观测只能覆盖有限区域,因此仅依赖当前观测容易丢失此前看到的地标信息。

作者认为,近期 VLA 模型虽然提供了从感知到动作的新范式,但直接迁移到空中导航仍面临三方面问题:一是策略主要基于当前观测时可能失去历史证据;二是单步动作预测难以提供短程规划结构;三是把停止动作与普通运动动作混在同一生成机制中,可能低估过早停止的不可逆风险。为此,作者将问题归纳为时序决策问题,并试图在一个因果闭环中统一历史访问、未来动作结构与显式终止。

需要说明的是,论文中的 “因果” 不是统计意义上的因果推断,而是指时间顺序上的信息访问边界:在决策步 tt,历史记忆 M<tM_{<t} 只能包含 tt 之前获得的观测,并在当前观测写入前被读取,从而防止未来信息泄漏。

核心方法和技术细节

DreamFly 建立在 Dream-VLA 的扩散 Transformer 骨干上,整体包含三个主要组件。

因果对齐历史记忆。系统维护 16 个 512 维长期记忆槽。记忆构造使用固定的 CLIPSeg 密集路由和 OWLv2 区域路由,从指令相关观测中提取候选视觉证据,并经过候选跟踪、置信度和新颖性筛选后写入槽位。每个槽位保留 anchor 和可选的 prototype 特征,以及有效性和更新时间信息。在决策步 tt,当前视觉 token 作为 query,历史槽位作为 key/value,通过带有效性掩码的交叉注意力检索上下文,再用门控残差连接到当前视觉表示。该记忆只在后续决策中接收当前观测信息,训练与部署使用相同的读前写协议。

滚动时域扩散规划。策略一次性预测长度 K=4K=4 的离散动作块,其中第一个动作对应当前控制决策,剩余三个动作仅作为短程规划目标。训练时使用有效前缀监督,对轨迹末尾缺失的位置用 Stop 填充,并通过有效掩码排除填充位置损失;同时使用 horizon decay γ=0.7\gamma=0.7 和 CAR 重加权(βcar=0.1\beta_{\mathrm{car}}=0.1)强调更近的动作。推理时通过 12 步离散扩散从全 mask 状态逐步解析动作 token,但只执行第一个动作,随后基于新观测重新规划。论文使用这种 “plan-KK, execute-one” 策略保留闭环视觉反馈。

LiteStop 终止模块。LiteStop 不从动作生成过程中隐式推断停止,而是直接使用扩散策略初始全 mask 状态下的动作 logit 网格 Ht(0)∈RK×∣A∣\mathbf{H}_t^{(0)}\in\mathbb{R}^{K\times|\mathcal{A}|},通过 LayerNorm 和 MLP 输出停止概率。它作为独立的二分类器训练,正类权重为 4.0;训练时冻结完整导航策略,只优化 LiteStop。终止阈值 ηstop=0.50\eta_{\mathrm{stop}}=0.50 基于 64 条校准轨迹从 0.50、0.65、0.80 中选择(见论文表 1)。最终终止条件同时保留动作级 Stop 和 LiteStop 的决策级停止。

创新点和贡献

论文提出三点贡献。第一,因果对齐历史记忆为在线记忆设置了明确的时间边界,避免当前观测通过历史分支提前泄漏到决策表示。第二,滚动时域扩散规划利用双向扩散骨干联合建模当前动作和短程未来动作,但不放弃闭环重规划。第三,LiteStop 把终止判断与运动动作生成解耦,从初始全 mask 规划表示中估计停止概率,而不改动已训练的动作策略。

这些设计在工程上也有意义:记忆构造与策略训练分离,策略训练和 LiteStop 训练分阶段进行,使得各模块可以相对独立地迭代。

实验结果分析

实验在 OpenFly 基准上展开。作者对数据做了标准化处理,包括纠正 Forward 6m 的 8 维动作编码、重映射非标准动作标签,并移除预打包历史关键帧,只保留当前 RGB 观测。最终训练集包含 85,785 条轨迹、1,356,622 个决策步;测试集包含 1,796 条轨迹,其中 test-seen 1,392 条,test-unseen 404 条。

在 test-seen 上,DreamFly 达到 44.87m NE、32.04% SR、46.77% OSR、28.22% SPL;在 test-unseen 上达到 45.29m NE、29.46% SR、46.78% OSR、23.54% SPL。与 Random、Action Sampling、Seq2Seq、CMA、AerialVLN 和 OpenFly-Agent 六个基线相比,DreamFly 在两个 split 上的 NE 最低,SR 和 SPL 最高(见论文表 2)。论文还指出,随机基线在初始距离已处于成功半径内时有更高条件成功率,因此其非零总体成功率受初始位置影响较大(见论文图 4)。

消融实验显示,相对于 Dream-VLA 基线,加入因果记忆后 SR 从 21.55% 提升到 24.11%,NE 从 67.82m 降到 48.93m;继续加入动作块和 LiteStop 后获得最优结果(见论文表 3)。移除记忆、动作块或 LiteStop 都会造成性能下降。按初始距离分层后,LiteStop 在最短距离组贡献最大,历史记忆在中间距离更明显,较长距离下记忆与动作块互补(见论文图 5)。定性分析中,三个失败案例分别展示了缺失历史记忆、缺失动作块预测和缺失 LiteStop 时的不同错误模式(见论文图 6)。

实践建议

对于希望在无人机导航、具身智能或 VLA 系统中落地类似设计的研究与工程团队,可从这篇论文中借鉴以下几点。

第一,在扩散策略或动作块策略中采用滚动时域执行。不要将预测出的未来动作缓存并连续执行,而是在每次获得新观测后重新规划。这样可以保留闭环反馈,并降低开环动作块对状态漂移的敏感性。

第二,历史记忆模块宜采用读前写的时间边界。无论训练还是部署,当前观测先作为当前视觉输入,只有进入下一决策步后才允许写入历史记忆。这样能减少训练与部署之间的信息可用性差异。

第三,终止判断可以考虑与运动动作生成解耦。若动作空间包含 Stop,仍然可以保留动作级停止条件;在此基础上增加一个轻量停止概率头,并利用初始全 mask 的规划 logit 网格作为输入。阈值应通过小规模校准集选择,而不是直接固定为 0.5。

第四,训练过程可以采用分阶段方式:先训练带记忆的动作策略,再冻结策略训练终止模块。这种设计降低了终止训练对运动策略的梯度干扰,也便于后续单独调整终止行为。

最后,如果目标是从仿真迁移到真实无人机平台,论文尚未提供真实实验证据。实践者应额外验证观测噪声、定位误差、通信延迟和 sim-to-real 域迁移的影响,不能仅根据 OpenFly 仿真结果推断真实环境表现。