EntityBench:迈向实体一致的长程多镜头视频生成
EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
论文信息
标题: EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
作者: Ruozhen He, Meng Wei, Ziyan Yang, et al.
发布日期: 2026-05-14
arXiv ID: 2605.15199v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:多镜头视频生成中,跨镜头保持人物、物体、场景的视觉一致性(实体一致性)是一大挑战,现有评估缺乏覆盖多实体类型、长序列、标准化指标的基准。
- 核心方法:构建了 EntityBench 基准(140 集,2,491 镜头,源自真实叙事媒体),并设计了 “三支柱” 评估框架(画质、提示跟随、跨镜头一致性),同时提出基于持久实体记忆库的生成系统 EntityMem。
- 关键结果:EntityMem 在字符保真度上取得最强效果(face_fidelity 0.740,相比次优基线 StoryMem 的 0.452,Cohen‘s d = +1.71,字符存在度达 0.967);但对象一致性落后于基线,DINOv2 嵌入相似度指标也不占优。
- 主要局限:EntityMem 的对象一致性劣于部分方法,且评估框架高度依赖多模态大模型(LLM)判断,尽管与人工一致性较高(κ=0.94),仍存在由模糊、光照等因素导致的判断不确定性。
- 适合读者:从事视频生成、多镜头叙事、生成式模型评估、视觉语言模型应用的研究人员和工程师,尤其关注长序列实体保真和评测体系设计者。
论文背景和研究动机
当前视频生成技术已在单镜头合成上取得显著进展,但真实故事创作要求多镜头序列中的人物、物品和地点在镜头切换间保持一致的视觉身份。这一 “实体一致性” 问题在长序列中尤为突出,微小的外观漂移会逐步累积,破坏叙事连贯性。
已有方法通过共享注意力、参考条件控制或自回归上下文来隐式处理一致性,但缺乏统一的评测框架来诊断跨镜头实体一致性在何处、为何失效。现有基准(见表 1)大多只关注单镜头画质,或仅提供有限的多镜头覆盖(如仅几十个镜头、只追踪单一实体类型、没有镜头过渡标注、评价维度狭窄)。这导致方法间的对比困难,也难以分析长距离实体一致性退化的具体模式。
为此,作者提出 EntityBench——一个大规模、多实体类型、多难度分层的基准,同时配套一个全面的三支柱评估体系,并借此验证显式实体记忆管理能否提升跨镜头一致性。
核心方法和技术细节
EntityBench 基准构建
EntityBench 从真实叙事媒体中提取原始视频片段,经过多阶段筛选与 LLM 增强,最终保留 140 集、2,491 个镜头,按照难易度分为三级(简单 80 集、中等 40 集、困难 20 集),最大序列长度达 50 镜头,最大复现间隔达 48 镜头。具体构建流程包括:
- 实体提取与链接:对人物使用目标检测、人脸检测与轨迹聚类,并通过 LLM 去重合并跨远距离镜头的身份;物体和场景则用 LLM 先分镜块提议局部注册表,再合并为全局身份。
- 脚本丰富与验证:将原始剪辑中的动作文本丰富化,消除静态描述,鼓励角色间交互,并通过多轮 LLM 校验确保镜头实体调度表中每个实体都出现在动作描述中,且无物理矛盾。
- 最终编排:每个镜头配有具体的实体调度表(指定出现哪些人物、物体、场景)以及场景边界和镜头过渡(硬切、连续)标注。
最终基准中,约 56% 的独特实体在 2 个及以上镜头中出现,68.6% 的实体-slot 出现是 “再现”(即需要从记忆而不是提示文本中恢复),构成强烈的跨镜头记忆测试信号。
三支柱评估框架
EntityBench 的评估体系由 51 个指标组成,分为三个渐进式支柱:
-
Pillar 1:单镜头画质 沿用 VBench 的 6 个维(如主体一致性、时序闪烁、运动平滑度等),独立评价每个镜头的技术质量。
-
Pillar 2:镜头内提示跟随
- 实体存在度:利用 GroundingDINO 和 CLIP 相似度判断每个被调度的实体是否真的出现在画面中,分人物、物体、场景三类统计。
- 实体保真度:针对检测到的实体裁剪区域,由多模态 LLM(Gemini 2.5 Pro)按类型特定标准(人物:面部、头发、服装、体型;物体:形状、颜色/纹理、比例、细节;场景:布局、色彩氛围、地标、视角)评分。
- 动作保真度:构造带标注框的 2×3 帧网格,让 LLM 从整体、主体身份、主体动作、物体交互、运动质量六个子维度评价动作是否被正确执行。
-
Pillar 3:跨镜头一致性 仅考虑 Pillar 2 中实体保真度评分超过阈值(0.5)的 “合格” 出现,然后对每个实体计算其所有合格裁剪的 DINOv2 嵌入到该实体中心的余弦相似度,以及基于锚点-成对比较的 LLM 判断(判断两镜头中同一实体是否保持身份一致)。场景一致性采用全帧输入并显式要求 LLM 忽略前景人物、关注地点本身。
所有聚合均采用 “保真度门控校正均值”:凡跳过或未通过门控的实例在该指标贡献上视为 0,从而避免方法通过只产出高保真但静态、低多样性的生成来刷高一致性分数。该框架与人工评价的对齐度通过 200 个样本的验证:LLM 的跨镜头身份判断κ=0.94,处于人类标注者之间的一致性范围内。
EntityMem:基于实体记忆的生成系统
EntityMem 在视频生成前就构建一个持久的实体记忆库,为每个实体预生成并验证视觉和文本参考,生成时每个镜头检索这些参考,避免从已生成输出中提取参考带来的误差累积。其流程分为三个阶段(由分专业 LLM 代理完成):
- 阶段 1:实体参考生成 分类代理决定哪些实体需要独立视觉参考。人像由肖像代理使用文本到图像模型在纯色背景上生成多候选图,分割后选择最佳,并通过验证代理检查错误特征或分割失败;否则更换背景颜色重试。场景生成全景图并裁剪为不同角度变体。
- 阶段 2:关键帧合成 布局代理根据动作文本和实体调度表,规划角色的水平网格位置、摄像机角度,并为动作跨度大的镜头生成多张关键帧。合成器将高度归一化的人物肖像与物体放置到场景背景上。
- 阶段 3:记忆增强的视频生成 将每镜头内的人物标记肖像和合成关键帧形成有序序列送入视频骨干,同时文本提示中自动注入再现实体的描述。对于连续镜头,前一镜头的尾帧作为首帧输入提供时序连续性,但不进入记忆库以免覆盖精心整理的实体参考。
创新点和贡献
-
首个覆盖多实体类型、长序列、标准化评估的基准 EntityBench 提供 140 集、2,491 镜头的规模,同时追踪人物、物体、场景三种实体,标注镜头过渡和记忆测试信号,远超此前仅包含单一实体或短片段的基准(见表 1)。
-
三支柱评估框架将实体一致性拆解为可诊断的维度 通过保真度门控、嵌入相似度与 LLM 判断结合、类型特定的评分标准,清晰分开 “实体是否被正确渲染”(Pillar 2)与 “正确渲染的实体是否跨镜头一致”(Pillar 3),且所有指标均基于统一的实体裁剪,审计链完整。
-
显式实体记忆管理的有效性证明 EntityMem 作为一种非训练式的记忆增强策略,展示了将实体视觉参考独立存储、在生成时检索,可极大提升人物保真度和存在度(字符 fidelity Cohen’s d = +1.71,存在度从 0.849 升至 0.967),为实体一致性提供了一个简洁有效的解耦思路。
实验结果分析
实验选取了三种代表性开放方法:整体式(HoloCine, CineTrans)和两阶段关键帧-动画式(StoryMem),并与 EntityMem 对比。主要发现如下:
-
实体保真度与存在度大幅领先 EntityMem 的 face_fidelity 为 0.740,高出 StoryMem 的 0.452,每一项子指标(面部、头发、服装、体型)均胜出 0.18–0.30(见附录 F.1)。character_presence 达 0.967,意味着 StoryMem 中每 8 次人物出现就缺失 1 次,而 EntityMem 几乎全部出现(表 4)。整体动作保真度也最好(0.618 vs. 0.547),主要来自主体身份和物体交互的提升。
-
跨镜头一致性呈现不同信号 在 DINOv2 嵌入相似度上 StoryMem 占优(cs_face 0.792 vs. 0.737),但 LLM 判断的身份指标上 EntityMem 大幅超越(llm_face_accuracy 0.406 vs. 0.226)(表 4)。这揭示嵌入相似度高并不等同于身份持久,EntityMem 在维持可识别的同一人物上更强。场景一致性上两者接近。
-
对象一致性与嵌入相似度是 EntityMem 的短板 EntityMem 在对象 fidelity(0.601 vs. 0.618)和对象跨镜头 LLM 分数(d = -0.60)上落后于 StoryMem(表 5)。论文分析认为,StoryMem 在场景级提示扩展时更能保留作为场景道具的物体身份,而 EntityMem 的记忆库中独立物体条件与基于关键帧微调的基础模型权重可能不兼容,基模型缺乏从独立物体条件整合视频的知识。
-
画质与实体一致性并非同一维度 CineTrans 在 Pillar 1 的成像质量、美学质量、运动平滑度上领先,但其人物保真度仅为 EntityMem 的一半不到(0.327 vs. 0.740),且人物存在率仅 0.796。说明整体画质好并不能自动保证实体身份准确。
实践建议
EntityBench 和 EntityMem 为多镜头视频生成系统的开发和评测提供了具体指导:
-
评测体系建立 实际项目可借鉴三支柱结构,尤其要设计保真度门控,防止模型通过生成模糊但高度一致的画面骗取高一致性分。同时,采用含人物、物体、场景多类型的实体调度表,可全面暴露身份漂移问题。
-
记忆分离策略 显式管理每个实体的参考图像,避免将先前帧整体作为上下文(易引入错误)。为人物预生成隔离的肖像参考并标注名称,有助于视频模型将文本名与视觉身份绑定。但需注意,独立对象条件可能与特定模型架构不兼容(正如 StoryMem 在对象上更优),需针对输出质量权衡。
-
长距离一致性观察 通过 EntityBench 的难度分层和间隙递减诊断(DINOv2 相似度 vs. 重复间隔的曲线),可定位方法在何种距离下开始失效,从而有针对性地设计记忆刷新或重识别机制。
-
LLM 评判的局限性控制 虽然本工作验证了 LLM 与人类判断的高一致性,但在模糊、极端光照下的案例仍可能出现分歧。实际部署时,应保留人工抽检通道,并积累边缘案例以微调评判提示或设立置信度阈值。
总体而言,EntityBench 为多镜头视频生成提供了一个严谨的 “考卷”,而 EntityMem 验证了实体级记忆是通往稳定叙事的可行路径,但仍有对象一致性和嵌入度量上的短板等待社区解决。