Fast-ThinkAct:通过可言语化的潜在规划实现高效的视觉-语言-动作推理

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

arXiv: 2601.09708v1

论文信息

标题: Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

作者: Chi-Pin Huang, Yunze Man, Zhiding Yu, et al.

发布日期: 2026-01-14

arXiv ID: 2601.09708v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:当前具备推理能力的视觉-语言-动作(VLA)模型在生成显式思维链时推理延迟极高,无法满足具身智能的实时控制需求(通常要求 1–15 Hz),且冗长推理可能引入无关信息。

  • 核心方法:提出 Fast-ThinkAct 框架,通过偏好引导的蒸馏将教师模型的长文本思维链压缩为少量连续隐式 Token(如 6 个),再通过可语言化解码器实现偏好对齐,同时引入视觉轨迹对齐以迁移空间规划能力。

  • 关键结果:在保持或超越当前最优推理 VLA 模型性能的前提下,推理延迟最高降低 89.3%,在 SimplerEnv-Google 上实现 9.3 倍加速(见论文图 3)。

  • 主要局限:可语言化解码器继承了预训练语言模型的幻觉问题,可能生成看似合理但不准确的描述(作者在结论中明确指出),且训练流程分为多个阶段,工程复杂度较高。

  • 适合读者:从事具身智能、机器人操作、视觉-语言-动作模型研究,以及对高效推理与大模型压缩部署感兴趣的工程师和研究人员。

论文背景和研究动机

近年来,视觉-语言-动作(VLA)基础模型通过大规模机器人示教数据训练,在基本操作任务(如抓取、放置)上取得了显著进展。然而,这类监督模仿学习的方法在长序列规划、失败自纠正以及新场景泛化方面表现薄弱(见论文引言部分)。为应对这一瓶颈,推理型 VLA 模型被提出,其核心思路是在动作执行前引入中间显式思维链(Chain-of-Thought, CoT)以增强模型的泛化与任务求解能力。

然而,显式 CoT 的引入带来了严重的推理延迟问题。以 ThinkAct-7B 为例,推理一次平均需数秒,对应的控制频率约 0.1 Hz,远低于机器人操作通常所需的 1–15 Hz。在自动驾驶等安全关键场景中,此类延迟还可能带来安全风险。因此,如何在保持推理能力的前提下实现紧凑表示,并可靠地捕获时空动态信息,成为推理型 VLA 领域亟待解决的核心挑战。

Fast-ThinkAct 正是在此背景下提出的。其设计目标是:用极少量连续隐式 Token 替代长达约 250 个 Token 的文本思维链,同时通过偏好对齐与视觉轨迹蒸馏,确保隐式表示的质量不低于显式文本推理。

核心方法和技术细节

Fast-ThinkAct 采用教师-学生蒸馏框架,分为两个核心阶段:高效具身推理训练(第 3.2 节)和推理增强策略学习(第 3.3 节)。下文逐一剖析技术细节。

1. 教师模型的显式推理与偏好信号提取

教师 VLM FθT\mathcal{F}_{\theta}^T 首先通过 GRPO(Group Relative Policy Optimization)强化学习训练,其优化目标为:

JGRPO(θ)=Eτ∼FθT[min⁡(rθ(τ)A(τ), clip(rθ(τ),1−ϵ,1+ϵ)A(τ))],\mathcal{J}_{\text{GRPO}}(\theta)=\mathbb{E}_{\tau\sim\mathcal{F}^T_\theta}\Big[\min\left(r_\theta(\tau)A(\tau),\ \text{clip}(r_\theta(\tau),1-\epsilon,1+\epsilon)A(\tau)\right)\Big],

其中,优势函数 A(τ)A(\tau) 基于组内奖励的标准化计算得出。教师模型在每次 rollout 中生成多条推理轨迹 τ\tau。这些轨迹的质量参差不齐,优势函数自然成为了区分推理质量的信号。Fast-ThinkAct 从每组中选择优势最高的轨迹 τ+\tau^+ 和最低的轨迹 τ−\tau^-,构成偏好对,作为后续学生模型蒸馏的监督信号。

2. 学生模型的隐式推理与可语言化对齐

学生模型 Fθ\mathcal{F}_\theta 不再输出文本 Token,而是自回归地生成 MM 个连续隐式向量 z={zm}m=1M\mathbf{z} = \{z_m\}_{m=1}^M,每个 zm∈Rdz_m \in \mathbb{R}^d,论文默认 M=6M=6。

为了保证隐式表征的可控性与可解释性,论文引入一个可训练的语言化解码器(Verbalizer)Vψ\mathcal{V}_\psi,其目标是将隐式向量解码为自然语言推理文本。训练目标借鉴 DPO(Direct Preference Optimization)思想,形式化为:

Lverb=−E[log⁡σ(β(log⁡pψ(τ+∣z)pref(τ+)−log⁡pψ(τ−∣z)pref(τ−)))],\mathcal{L}_{\text{verb}} = -\mathbb{E}\Big[\log\sigma\Big(\beta\big(\log\frac{p_\psi(\tau^+|\mathbf{z})}{p_{\text{ref}}(\tau^+)} - \log\frac{p_\psi(\tau^-|\mathbf{z})}{p_{\text{ref}}(\tau^-)}\big)\Big)\Big],

其中 prefp_{\text{ref}} 为无隐式条件时的参考分布,β=0.1\beta=0.1。该损失函数鼓励学生模型生成的隐式表征让解码器更倾向于还原高质量推理 τ+\tau^+,同时抑制低质量推理 τ−\tau^-。

3. 动作对齐的视觉规划蒸馏

单纯的语言对齐尚不能确保隐式表征捕获空间视觉规划能力。为此,Fast-ThinkAct 引入了轨迹级表示对齐损失:

Ldistill=∥htT−ht∥22,\mathcal{L}_{\text{distill}} = \| h_t^T - h_t \|_2^2,

其中 htTh_t^T 和 hth_t 分别是教师和学生模型在 <answer> 特殊 Token 上的隐藏状态。同时,学生模型使用 KK 个可学习的空间 Token(论文中 K=5K=5),每个空间 Token 通过 MLP 直接预测一个二维路径点,避免了教师模型需要 60–70 个 Token 才能完成的自回归路径规划。这部分损失记为 Lans\mathcal{L}_{\text{ans}}。

学生模型的总损失为三者的加和:

Lstudent=Lverb+Ldistill+Lans.\mathcal{L}_{\text{student}} = \mathcal{L}_{\text{verb}} + \mathcal{L}_{\text{distill}} + \mathcal{L}_{\text{ans}}.

4. 推理增强的动作执行

完成隐式推理训练后,学生 VLM 的权重被冻结。其空间 Token 在早期层的 KV Cache 被提取为视觉规划隐向量 ctc_t,通过交叉注意力机制注入到基于扩散 Transformer 的动作模型 πϕ\pi_\phi 中。动作模型仅通过模仿学习损失 LIL\mathcal{L}_{\text{IL}} 进行微调,实现高层视觉规划到低层动作执行的衔接。

在推理阶段,仅需运行学生 VLM 和动作模型,无需调用语言化解码器,从而大幅降低推理延迟。

创新点和贡献

Fast-ThinkAct 的创新主要体现在三个层面。

第一,将显式文本推理压缩为可语言化隐式思维。 与已有工作(如 Coconut、CODI)在纯 LLM 场景中探索隐式推理不同,Fast-ThinkAct 首次在具身 VLA 场景中构建了 “隐式推理—语言化监督—偏好对齐” 的完整训练范式,从而在压缩推理长度的同时保证了表征质量。

第二,引入动作对齐的视觉轨迹蒸馏。 论文不仅压缩文本推理,还通过对齐隐藏状态与并行空间 Token 预测路径点的方式,将教师模型的视觉规划能力迁移到学生模型的紧凑表征中。这种 “文本推理 + 视觉规划” 双重蒸馏的设计,使得隐式表征能够同时承载语言级策略和空间级操作信息。

第三,构建 “隐式规划—动作执行” 解耦推理架构。 通过冻结 VLM 并仅微调动作模型,Fast-ThinkAct 实现了推理效率与动作策略训练的分离,该方法被证明可与 DiT-Policy 或 RDT 等多种现有动作骨干网络兼容。

实验结果分析

论文在具身推理和机器人操作两大类任务上进行了全面评估。

推理效率(图 3f): 相比 ThinkAct-7B 和 MolmoAct-7B,Fast-ThinkAct 的推理延迟分别降低了 89.3% 和 88.0%,在 3B 规模上比 ThinkAct-3B 快 7 倍,而任务成功率反而更高。这表明隐式推理并非以牺牲性能为代价。

机器人操作(表 1、图 3a–e、表 5): 在 LIBERO 四个子任务和 SimplerEnv-Google 上,Fast-ThinkAct 均超越所有对比基线,包括 OpenVLA、CoT-VLA、ThinkAct 和 MolmoAct。在 RoboTwin2.0 双机械臂操作基准上,模型在简单和困难设置下分别取得 65.7 和 26.4 的平均成功率,显著优于 RDT 和 ThinkAct(见表 1)。值得注意的是,在长序列任务(平均超过 270 步)上,Fast-ThinkAct 的简单/困难成功率分别为 48.8/16.8,显式推理模型 ThinkAct 为 42.8/15.3,进一步证明了紧凑隐式表征在长程规划中的有效性。

具身推理能力(表 2、表 4): 在 EgoPlan-Bench2、RoboVQA 和 OpenEQA 三个基准上,3B 规模的 Fast-ThinkAct 超越 GPT-4V 和 Gemini-2.5-Flash 等商用模型。在 RoboVQA 上,其 BLEU 平均分数达到 60.8,较第二名 ThinkAct-3B 提升了 5.5 分。7B 版本同样保持优势,验证了方法的可扩展性。

消融实验(表 3、表 7): 去除 Lverb\mathcal{L}_{\text{verb}} 后,具身推理平均得分从 52.8 下降至 48.5;进一步去除 Ldistill\mathcal{L}_{\text{distill}} 后降至 47.7。在 LIBERO、SimplerEnv-Google 和 RoboTwin2.0 上,完整模型的平均成功率(68.2)也显著高于去除任一损失的版本。这些结果证明,偏好对齐与视觉轨迹蒸馏对隐式推理质量均有关键贡献。

失败恢复与少样本适应(图 5、图 6): 在 RoboFAC 基准上,Fast-ThinkAct 较 RoboFAC-3B 在仿真和真实场景中分别提升 10.9 和 16.4 分,展示了隐式推理对运行故障的识别与纠正能力。在 RoboTwin2.0 的少样本实验中,仅使用 10 个示教样本进行微调,Fast-ThinkAct 即显著超越 RDT 和 ThinkAct,显示出更强的样本效率。

实践建议

  1. 分层蒸馏在部署边缘端 VLA 模型时值得优先考虑。 如果团队已有成熟的显式推理 VLA 教师模型,Fast-ThinkAct 提供了一套可复现的隐式蒸馏流程。建议先从偏好对构建入手,利用 GRPO 产生的优势信号自动生成高质量/低质量推理对,再结合轨迹对齐损失进行微调。

  2. 隐式 Token 数量需根据任务复杂度进行调优。 论文消融实验显示,M=1M=1 时容量不足,M=30M=30 或 100100 时可能引入冗余噪声(见论文图 8)。在复现时,建议从 M=6M=6 出发,针对具体场景(如单臂或双机械臂)进行小范围搜索。

  3. KV Cache 层级选择对动作模型至关重要。 论文明确比较了早期层 KV Cache、晚期层 KV Cache 和输出隐藏状态三种条件方式,早期层 KV Cache 表现最优(LIBERO 成功率 89.7 vs. 88.3 vs. 87.1)。在实际部署时,应当保留该设计选择,避免因工程便利而直接使用输出隐藏状态。

  4. 可语言化解码器仅用于训练阶段,且可能产生幻觉。 在推理部署中可完全移除,以最大化加速收益。若需保持系统可解释性以进行人工审查或安全审计,建议对解码器输出设置置信度过滤或引入外部事实检验机制。