LongVideoAgent:基于长视频的多智能体推理

LongVideoAgent: Multi-Agent Reasoning with Long Videos

arXiv: 2512.20618v1

论文信息

标题: LongVideoAgent: Multi-Agent Reasoning with Long Videos

作者: Runtao Liu, Ziyi Liu, Jiaqi Tang, et al.

发布日期: 2025-12-23

arXiv ID: 2512.20618v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决什么 现有长视频理解模型通常将小时级视频压缩为有损摘要或依赖有限工具集,导致细粒度时序证据丢失,难以回答需要精确定位和视觉细节的问题。

  • 核心方法:用什么办法解决 提出多智能体框架 LongVideoAgent,由一个主智能体(MasterAgent)协调一个定位智能体(GroundingAgent)定位相关片段,再调用一个视觉智能体(VisionAgent)提取视觉细节,主智能体通过多轮交互累积证据后作答。

  • 关键结果:最重要的一个结论或数字 在 LongTVQA 数据集上,多智能体方法显著优于非智能体基线,例如 Agentic-Grok 达到 82.65% 准确率,相较其纯文本基线提升 5.75 个百分点(见表 2)。

  • 主要局限:作者自己承认的、或方法本身固有的限制 依赖外部提供的字幕而无法处理原始音频;视觉和定位智能体在强化学习训练期间保持冻结,未进行联合优化;奖励函数仅基于格式正确性和答案对错,较为简单。

  • 适合读者:什么背景的人值得读 适合从事多模态大模型、视频理解、智能体系统以及强化学习应用的研究者和工程师阅读。

论文背景和研究动机

长视频理解是多模态大模型领域的一个新兴难题。在长达数小时的视频中,关键信息稀疏地分布在时间轴上,且同时存在于视觉帧、对话、音频等多种模态中。早期的指令微调系统(如 Video-LLaMA)已初步展示了联合处理采样视频帧的能力,但大多数方案仍然局限于短视频片段或粗粒度摘要。这些 “非智能体” 模型在处理长视频时,通常将完整的视觉流一次性或高度下采样后送入模型,将时序推理的负担转移到了信息损耗严重的早期压缩阶段,导致细粒度证据难以恢复。

近年来,部分工作开始将长视频理解重构为智能体驱动的过程。例如 VideoAgent 框架引入了一种范式,由核心大模型主动决定下一步观察什么、何时调用外部工具。然而,该框架的工具集相对简单,主要依赖通用的视觉-语言基础模型进行字幕生成和图像检索,难以捕获细粒度的语义、物体指代或微妙时序线索,且缺乏多步决策和基于强化学习的规划能力。

上述局限催生了本研究。论文的核心动机在于设计一种既能高效定位、又能精细感知的多智能体协同框架,使模型能够像人类一样,在长视频中定位相关片段、查看视觉细节、反复验证,直到累积足够证据再回答问题。

核心方法和技术细节

LongVideoAgent 的整体架构如图 2 所示,由三类智能体角色组成:

主智能体负责高层推理与决策。它在有限步数 KK 内循环运行,每轮根据已累积的字幕、定位标记和视觉观察,生成一个结构化动作标记:<visual_query> 请求视觉读取、<request_grounding> 请求重新定位,或 <answer> 终止并给出最终答案。系统提示词(表 1)对工具调用持保守态度,要求主智能体在证据充分时立即作答,避免无谓的额外调用。

定位智能体接收问题和完整字幕,输出一个时间片段标记 <clip_X>,指向视频中和问题相关的部分。主智能体可以在推理过程中多次重新请求定位,以修正或细化定位结果。

视觉智能体针对被定位的片段和主智能体给出的具体视觉需求(如物体属性、动作、屏幕文字、场景线索),从帧序列中提取文字形式的观察描述。这些描述被追加到主智能体的上下文中,驱动下一轮决策。

对于开源大模型作为主智能体的情况,论文采用 GRPO 算法进行强化学习微调,而定位和视觉智能体保持冻结。长视频问答被建模为有限视界决策过程。奖励函数由两部分组成:每步的结构格式正确性奖励 rtfmt∈{0,1}r_t^{\text{fmt}} \in \{0,1\},要求在动作字符串中恰好包含一个完整闭合的顶层标签;以及仅在终止时给出的答案正确性奖励 rans∈[0,1]r^{\text{ans}} \in [0,1],按选择题精确匹配判定。轨迹总回报为 R(τ)=α∑t=0Trtfmt+ransR(\tau) = \alpha \sum_{t=0}^{T} r_t^{\text{fmt}} + r^{\text{ans}},这种简洁的两信号奖励足以引导多轮协调的结构化推理,无需额外密集奖励信号。

创新点和贡献

论文的核心贡献可归纳为三个层面。一是模块化多智能体架构,通过主智能体协调定位与视觉专用智能体,实现了长视频中 “定位-感知-推理” 的显式分工。二是基于奖励的强化学习训练方案,推动主智能体在保持回答准确的同时,学习何时调用工具、何时停止并作答,从而生成简洁、高效且可解释的多步推理轨迹。三是构建了剧集级长视频基准数据集 LongTVQA 和 LongTVQA+。这两个数据集基于 TVQA 和 TVQA+ 聚合而成,将同一剧集内的所有片段合并为小时级的完整剧集序列,并重新索引时间戳和边界框。在该基准上,LongVideoAgent 达到了当时的最优结果。

实验结果分析

实验以答案准确率为主指标,在 LongTVQA 和 LongTVQA+ 的验证集上进行评估。

多智能体架构的有效性:在统一基座模型下,从纯文本非智能体模式切换到多智能体模式带来了显著收益。例如 Agentic-Grok 比纯文本 Grok 提高 5.75 个百分点(LongTVQA 上 82.65% vs. 76.90%),Agentic-GPT5-mini 提高了 8.71 个百分点(见表 2)。对于开源模型 DeepSeek-R1,智能体方式也带来 1.31 个百分点的提升。

强化学习的作用:对开源模型而言,强化学习微调的增益尤其突出。以 Qwen2.5-7B 为例,在智能体模式下添加 GRPO 训练,LongTVQA 准确率从 46.10% 跃升至 60.20%(提高 14.10 个百分点),LongTVQA+ 上从 60.30% 升至 70.80%(提高 10.50 个百分点)。即使是 3B 的小模型,强化学习也带来了超过 20 个百分点的提升(见表 2)。

消融实验揭示的组件贡献:从非智能体文本基线(64.3%)起步,仅增加定位智能体即可使准确率提升至 69.0%(+4.7 个百分点),再增加视觉智能体后进一步提升至 74.8%(+5.8 个百分点),总体提升达 10.5 个百分点(见表 4a)。这说明定位首先过滤了无关干扰,视觉感知则补全了字幕所缺失的细粒度线索。

关键超参数的影响:步数上限 KK 从 2 增加到 5 时,定位准确率和回答准确率同时提升,但增加到 10 时收益递减甚至持平,因此默认取 K=5K=5(见表 4b)。扩大证据窗口(同时输入相邻片段)可以持续改善精度:窗口从 1 个片段扩大到 3 个片段时,定位准确率从 71.67% 升至 81.94%,回答准确率从 70.33% 升至 77.26%,但代价是更大的视觉查询开销和延迟(见表 4c)。

视觉模型质量的重要性:将视觉智能体从 Qwen3-VL-235B 替换为 GPT-4o 后,定位准确率提升 2.30 个百分点,回答准确率提升 4.33 个百分点(见表 4d)。这说明更强的视觉识别能力(小物体、文字、细粒度属性)直接转化为长视频问答的更好结果。

案例展示(表 3 和表 5)进一步体现了多智能体协同推理的可解释性优势:主智能体能够明确输出其思考过程,例如先判断字幕缺乏空间信息,再主动请求视觉智能体探查窗户与床的位置关系,最终依据视觉证据选定正确答案。

实践建议

如果计划在实际系统中部署或复现类似框架,以下几点值得注意。

算力与延迟的权衡:多智能体多轮调用带来的推理开销不可忽视。论文采用 K=5K=5 和窗口大小为 1 的默认设置,在精度和延迟之间取得了折中(见第 4.5 节消融实验)。在资源受限的场景下,可以优先尝试较小的步数上限,以换取更低的响应时间。

视觉智能体的选型:实验表明更强的视觉模型直接提升整体精度(表 4d)。在实际工程落地时,可结合场景所要求的识别粒度(如是否需要 OCR、小物体检测)来选择视觉能力合适的模型,不必一味追求最大模型。

强化学习的适用条件:GRPO 训练在开源小模型上的增益尤为明显(Qwen2.5-3B 提高超 20 个百分点),但对于已有强推理能力的闭源大模型,论文并未对其做 RL 微调。因此,如果基座模型本身已具备良好的指令遵循和多步推理能力,可以在初始阶段仅采用提示工程的智能体模式,在观察到推理轨迹格式不规范或调用冗余时,再考虑引入格式奖励进行轻量微调。

从字幕到音频的自然延伸:论文明确指出其依赖外部字幕而无法处理原始音频。在实际应用中,可集成 ASR 模块将音轨实时转化为文本字幕,从而消除对现成字幕文件的依赖,使系统能够处理更广泛的无字幕长视频来源。