AVGen-Bench:面向文本到音视频生成的多粒度评估任务驱动基准

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

arXiv: 2604.08540v1

论文信息

标题: AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

作者: Ziwei Zhou, Zeyuan Lai, Rui Wang, et al.

发布日期: 2026-04-09

arXiv ID: 2604.08540v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题: 现有的文本到音视频(T2AV)生成评估标准碎片化,主要孤立评估音频或视频,或依赖粗粒度的嵌入相似度,无法捕捉真实复杂提示词所需的细粒度联合正确性。
  • 核心方法: 提出了一个任务驱动的基准测试 AVGen-Bench,包含 11 个真实场景类别的高质量提示词,并构建了一个结合轻量级专家模型和多模态大语言模型(MLLM)的混合式多粒度评估框架。
  • 关键结果: 即使是最先进的 T2AV 模型,在音乐音高控制、场景文本渲染和物理逻辑推理等细粒度语义控制任务上也存在普遍且严重的失败,揭示了模型在 “视觉逼真” 与 “语义精准” 之间的巨大鸿沟。
  • 主要局限: 音高准确性(Pitch Accuracy)自动评估指标与人类判断的相关性较低(Pearson 相关系数为 0.5544,见表 3),作者将此归因于当前模型在该任务上表现极差导致的 “地板效应”。
  • 适合读者: 适合从事生成式 AI 模型评估、音视频多模态生成、以及希望深入理解当前 AI 视频模型具体能力边界与失败模式的研究人员和工程师。

论文背景和研究动机

近年来,生成式视频领域正经历一场从 “无声” 的文本到视频(T2V)合成向多模态的文本到音视频(T2AV)生成的根本性转变。随着 Sora 2、Veo 3.1、Kling 2.6 等前沿系统的涌现,T2AV 正迅速成为用户进行内容创作的主流界面。然而,与模型的快速迭代形成鲜明对比的是,对 T2AV 的评估标准出现了严重的瓶颈:缺乏一个严格且全面的评估框架。

现有的基准测试大多设计用于单模态场景,例如视觉领域的 VBench 系列专注于视频质量,而音频基准则孤立地评估声音。近期一些尝试统一评估的工作,如 HarmonyBench、UniAVGen 等,仍存在两大关键缺陷。其一,它们多依赖粗粒度指标,仅能给出一个整体的质量分数,无法区分具体的错误类型,如音高错误或文本渲染失败。其二,联合评估被简化为使用 CLIP 或 CLAP 等模型的嵌入相似度,这种 “黑箱” 指标无法验证具体音符或精确唇形同步等细粒度语义对齐。这导致在实际使用中,模型出现的种种问题——如无意义的语音内容、与环境不符的音效、错误的乐谱或违背物理定律的运动——长期处于 “可感知却不可度量” 的状态。

为了弥补这一鸿沟,本文作者提出了 AVGen-Bench,这是一个专为 T2AV 生成设计的、以任务为驱动的基准测试。它的核心理念是从真实的用户意图和应用场景出发,而非为适配现有指标而反向设计提示词,从而实现对模型能力的更有意义和更具诊断性的评估。

核心方法和技术细节

AVGen-Bench 的构建围绕两个核心支柱:一个任务驱动的提示词集和一个多粒度的混合评估套件。

任务驱动的提示词集构建

作者采用了一种 “意图优先、自顶向下” 的策划策略。首先定义了覆盖专业媒体制作、创作者经济和世界模拟三大领域的 11 个用户场景,然后利用 GPT-5.2 生成候选提示词,再经过严格的人工审查筛选。最终数据集包含235 个精心策划的任务,平均每个提示词包含88.54 个Token(见表 1),远超其他基准,确保了评估的复杂性(见图 4a)。

关键技术亮点在于提示词设计与评估指标的完全解耦。例如,在 “世界模拟器” 的物理和化学类别中,作者特意采用了 “欠规范提示”(Underspecified Prompting)策略,仅描述实验装置(如牛顿摆),而不说明物理结果,以此测试模型是否依赖其 “世界知识” 来模拟正确的动力学,而非简单遵循文字指令。在 “创作者经济” 的音乐教程类别中,提示词则注入了细粒度的声学约束,如明确要求演奏 “C 大调音阶”,以严格考察模型的精准音视频对齐能力。

多粒度混合评估框架

评估框架采用混合策略,整合轻量级专家模型与 MLLM(具体为 Gemini 3 Flash),覆盖从信号级精度到高级语义推理的三个维度(见图 3):

  • 基础评估模块:评估单模态美学(视觉用 Q-Align,音频用 Audiobox-Aesthetic)和跨模态对齐(通用同步用 Syncformer,唇音同步用 SyncNet)。

  • 细粒度评估模块:这是本研究的核心创新。针对当前模型的顽固失败模式,设计了 6 个 “检测-推理” 混合评估流水线:

    1. 场景文本渲染:通过 PaddleOCR 提取文本,再送入 MLLM 进行双重评估:验证是否遵循显式文本要求,以及评估附带文本(如背景中的标牌)的语义连贯性。
    2. 面部一致性:利用 InsightFace 提取面部嵌入,通过 DBSCAN 聚类发现身份,再与 MLLM 从提示词中预测的角色数量进行比对,并计算身份稳定性。
    3. 音高准确性:采用符号-神经验证流水线。先用 Gemini 从提示词中提取乐理约束(如 “C 大调和弦”)转为结构化 JSON 格式,然后用 Basic-Pitch 将音频转录为 MIDI 事件,最后再交由 Gemini 进行符号逻辑验证(见图 10)。
    4. 语音可懂度与连贯性:使用 Faster-Whisper 进行语音转录,然后由 Gemini 进行自适应合规性审核。该机制分为 “逐字模式”(严格词汇匹配)和 “上下文模式”(评估语义与场景的吻合度)。
    5. 物理合理性:解耦为两个模块。低层次运动学评估使用 VideoPhy2-AutoEval,高层次因果推理则通过 Gemini 的二阶段语义验证:先提取提示词中的 “可观察期望”,再匹配视频中的视觉证据。
    6. 整体语义对齐:通过 Gemini 的 “分解-验证” 流水线,将提示词分解为叙事节奏、视觉属性、音频事件、摄影技术等可检查约束,然后逐一验证并评分。

创新点和贡献

本文的贡献可以概括为三个层面:

  1. 一个任务驱动的评估范式:AVGen-Bench 首次将 T2AV 评估从 “指标导向” 转变为 “用户任务导向”,其提示词集完全源于真实场景,且与具体检测器解耦,具有高度的可扩展性。
  2. 一个多粒度、混合式的评估框架:创造性地结合了专家模型的信号级精度与 MLLM 的高级语义推理能力,首次系统性地评估了从感知质量到细粒度语义可控性的全频谱能力,尤其是针对场景文本、音高、物理逻辑等 “硬核” 语义维度。
  3. 一份系统性的 T2AV 失败模式诊断:通过全面的实验,揭示了当前最强模型间一个鲜明的割裂现象:强烈的视听美学 vs. 薄弱的语义可靠性。

实验结果分析

实验评估了 Veo 3.1、Sora 2、Kling 2.6 等 13 个主流的商业和开源 T2AV 系统,结果量化了模型在多个维度的能力边界。

  • 基础美学与细粒度可控性的巨大鸿沟:模型在单模态视觉质量上得分极高(如 Seedance-1.5 Pro 达 0.970),但在音高准确性上 “完全失败”(所有模型得分均低于 12/100,见表 2)。模型仅能生成乐器的 “音色”,无法遵循任何关于特定音符或音阶的指令,本质上仍是一个 “概率纹理生成器”。

  • 文本渲染的二元化:模型在渲染大尺寸、显式提示的短文本时表现尚可,但面对长文本或小字体时常出现 “字形崩塌”。更具诊断性的是,对于提示词未显式定义的 “附带文本”,所有模型均一致地产生无意义的涂鸦状幻觉(见图 2 和图 7),揭示了其对现实世界文本分布理解的缺失。

  • 语音生成的领先者与普遍缺陷:Veo 3.1 系列在语音可懂度上表现卓越(Quality 版本得分96.09,见表 2),基本弥合了视频生成与 TTS 的鸿沟。然而,其他模型在 “上下文模式” 下普遍生成无法理解的 “外星语”,或在 “逐字模式” 下遗漏或截断长难句。

  • 物理世界建模的普遍乏力:运动学评估显示,即使是最佳模型(LTX-2 得分为 3.99)也未能超过 VideoPhy2 设定的 “合格线”(4.0)。在高层推理中,模型普遍无法模拟 “钠浮于水面” 等基本物理现象,暴露了其世界知识的匮乏。

研究成果的可靠性通过大规模用户调研得到了验证。在六个细粒度维度上,自动评估分数与 10 位专家评分的 Pearson 相关系数在五个维度上超过 0.82(例如整体语义对齐为0.8402,见表 3),证明了自动评估与人类判断的高度一致性。

实践建议

基于 AVGen-Bench 的诊断结果,为不同角色的从业者提供以下实践建议:

  • 对于模型开发者:

    • 警惕 “美学陷阱”:不要被高视觉质量分数所迷惑。应将文本、音乐、物理等细粒度语义对齐作为核心优化目标,可将 AVGen-Bench 的评价模块直接集成到训练或 RLHF(基于人类反馈的强化学习)流程中作为奖励信号。
    • 改进训练数据:当前模型在附带文本和音高控制上的普遍失败,暗示其训练数据中缺乏精细的多模态对齐标注。应构建包含细粒度音视频对应关系(如按键-音符对、物理过程-音效对)的高质量数据集,并探索更细粒度的跨模态监督信号。
    • 架构层面:统一架构(如 Veo 3.1)在语义连贯性上表现优于级联流水线,建议继续探索原生多模态的联合生成架构,而非简单的 T2V+V2A 串联。
  • 对于内容创作者与工具使用者:

    • 管理期望,聚焦优势:当前 T2AV 工具擅长生成具有 “电影感” 氛围的素材,但无法作为精准的物理模拟器或音乐编辑器。在提示词写作时,应充分发挥其对视觉风格的渲染能力,避免依赖其完成精确的物理实验或复杂的音乐指令。
    • 采用 “分而治之” 的策略:对于要求极高的专业制作,可将复杂任务分解。先生成符合视觉需求的静音视频,再使用专业的视频到音频(V2A)或音频编辑工具进行后期配音和音效制作,以弥补当前端到端模型在细粒度音频控制上的不足。