LumosX:关联任意身份与其属性以进行个性化视频生成

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

arXiv: 2603.20192v1

论文信息

标题: LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

作者: Jiazheng Xing, Fei Du, Hangjie Yuan, et al.

发布日期: 2026-03-20

arXiv ID: 2603.20192v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:在个性化多主体视频生成中,如何显式地将不同主体的面部与其属性(发型、服饰、配件等)准确绑定,避免跨主体特征混淆和属性错误分配。
  • 核心方法:从数据与模型双层面入手。数据侧设计流水线自动提取带有人脸-属性依赖的样本;模型侧引入关系自注意力(R2PE+CSAM)和关系多级交叉注意力(MCAM),通过位置编码和掩码强制每个主体的人脸-属性对内聚、组间隔离。
  • 关键结果:在包含 500 个视频的多主体测试基准上,Lumos 𝒳 的主体一致性评估中,面部相似度 ArcSim 达到 0.454,超过 Phantom(0.444)和 SkyReels-A2(0.271)(表 3),同时整视频语义相似度 ViCLIP-V 达 0.932,明显占优。
  • 主要局限:训练数据中主体数量不超过 3 人,模型基座为 Wan2.1-1.3B,扩展到 4 个以上主体时推理稳定,但到 10+ 主体时位置编码外推可能失效;对复杂多人动态交互(如拥抱、递物)的建模尚未显式整合。
  • 适合读者:从事视频生成、扩散模型可控合成、多条件个性化内容创作的研究者与工程师,尤其是关注身份一致性、多主体绑定机制和 DiT 架构改造的读者。

论文背景和研究动机

视频生成领域近年来由扩散模型主导,尤其是基于 Diffusion Transformer (DiT) 的架构在文生视频(T2V)上取得了巨大成功。然而,实际应用中要求对多个前景主体进行个性化控制,并保持每个主体与其属性(衣物、配饰、发型等)的准确对应。现有工作要么只针对单人脸的 ID 保持生成,要么在开放集多主体定制时将所有条件图像简单拼接后送入模型,缺乏显式的绑定机制,导致生成结果频繁出现人脸-属性错配(如 A 的面孔穿上了 B 的衣服),尤其当两个主体共用同一类名词(如 “左边男人” 与 “右边男人”)时,文本歧义会加剧混淆。

Lumos 𝒳 的作者指出,要解决这一瓶颈,必须在数据层和模型层同时施加显式约束:数据上需明确指定每张人脸与哪些属性对应;模型上需在生成过程中将每对面孔-属性捆绑为独立的主体组,并增强组内关联、抑制组间干扰。

核心方法和技术细节

Lumos 𝒳 基于 Wan2.1 T2V 模型构建,其核心设计可分为两部分。

数据构建流水线

为获得显式的人脸-属性依赖数据,作者设计了自动化处理流程(图 2):

  1. 描述生成与人体检测:用大视觉语言模型 VILA 为原始视频生成细粒度描述,并用 YOLOv9 检测人体。
  2. 实体词抽取与人脸-属性匹配:利用多模态大模型 Qwen2.5-VL,结合视觉先验从描述中抽取主体(人脸+属性)、物体、背景三类实体词,并将不同属性精准分配给对应的人体检测结果,解决同名主体混淆。
  3. 条件图像获取:对检测到的人脸进行裁剪,用 SAM 分割属性区域;对物体用 GroundingDINO+SAM 分割;对背景则移除前景物体后用 FLUX 修复生成干净背景图。每个实体随机从抽样的多帧中选取一张作为条件图像,从而构建了 1.57M 样本的训练集(单主体 1.31M,双主体 0.23M,三主体 0.03M)。

关系注意力机制

模型侧在 DiT 的每次自注意力和交叉注意力中插入专用模块(图 3)。

Relational Self-Attention

  • R2PE(关系旋转位置编码):为条件图像 token 扩展原有的 3D-RoPE。背景和物体 tokens 按实体次序在时间索引 ii 上递增;对于主体组(人脸+属性),同组的所有 token 共享同一个时间索引 ii,不同属性 token 在空间索引 j,kj,k 上错开(公式 1)。这强制同组 token 在位置编码上天然靠近,有利于注意力绑定。
  • CSAM(因果自注意力掩码):在自注意力计算时施加布尔掩码,仅允许(1)同个主体组内部的人脸与属性 tokens 互相关注;(2)视频 tokens 单向关注所有条件 tokens,而条件 tokens 不关注彼此或视频 tokens(公式 2)。这样既能保证去噪分支独立聚合条件信号,又防止条件分支间干扰。

Relational Cross-Attention

  • MCAM(多级交叉注意力掩码):在交叉注意力中引入数值掩码,定义三类关联强度:强相关(+1)用于视觉条件 tokens 与其对应的文本词 tokens 之间,以及同一主体组内的视觉与文本 tokens 之间;弱相关(-1)用于不同主体组视觉与文本 tokens 之间;其他为普通相关(0)。将掩码乘以动态缩放因子 s\mathbf{s}(由查询下采样后与键的近似相似度算出)和强度控制参数 rr 后,加到注意力分数上(公式 4)。MCAM 不仅强化了视觉 tokens 与对应文本的语义对齐,还显式抑制了跨组的信息混合。

创新点和贡献

  • 数据创新:提出一套全自动的、能显式标注人脸-属性依赖关系的视频数据构建流水线,并据此建立了包含身份一致性和主体一致性两个子任务的评估基准。
  • 模型创新:将 “主体组” 概念显式嵌入模型结构,通过 R2PE 和 CSAM 在位置编码与自注意力层面强制组内绑定,再通过 MCAM 在交叉注意力层面同时增强组内关联、削弱组间干扰,形成了一整套面向多主体定制的解耦机制。
  • 综合性能:在自建基准上,Lumos 𝒳 在身份一致性(单/多人脸)和主体一致性(含人脸、属性、物体、背景)多项指标上均超过 ConsisID、Concat-ID、SkyReels-A2 和 Phantom 等开源先进方法(表 1-3,图 5),尤其在多主体情况下优势显著。

实验结果分析

在身份一致性视频生成任务(仅输入人脸图像)中,Lumos 𝒳 的单人脸 ArcSim 达到 0.542,优于 ConsisID 的 0.458 和 Concat-ID 的 0.467;多人脸时 ArcSim 为 0.485,强于 Phantom 的 0.434(表 2)。在更全面的主体一致性任务中,Lumos 𝒳 的整视频语义相似度 ViCLIP-V 达 0.932,远高于 SkyReels-A2 的 0.839 和 Phantom 的 0.865;面部相似度 ArcSim 为 0.454,也优于 Phantom 的 0.444(表 3)。消融实验证实,R2PE 极大改善了面部混淆(ArcSim 从 0.316 升至 0.363),CSAM 进一步挽回文本相似度,而 MCAM 在 r=0.5r=0.5 时让 ArcSim 跃升至 0.429(表 4)。定性结果(图 5)直观展示了 Lumos 𝒳 避免人脸-属性错配的能力。

附录中进一步显示,模型在 4 主体推理时仍稳定保持优势,且当主体数提升至 10 人时,瓶颈主要在于基础模型 Wan2.1-1.3B 自身生成多人的能力,而非定制机制(图 8)。

实践建议

对于希望将 Lumos 𝒳 或类似方案落地的开发者,以下几点值得参考:

  1. 数据流水线复用:论文的数据构建流程高度自动化,依赖的组件(VILA、Qwen2.5-VL、YOLOv9、SAM、GroundingDINO、FLUX)均为开源,可直接复现。在实际项目中,可先将原始视频库转化为带有人脸-属性配对标签的训练样本,注意使用 FLUX 而非较弱的修复模型以保障背景自然度(附录表 10,FLUX FID=92.83 优于 SD-2 的 96.32)。
  2. 模块移植到更强基座:所提出的 R2PE、CSAM、MCAM 均与 DiT 具体结构解耦,作者已声明可迁移至 HunyuanVideo 的 MM-DiT 或 MAGI-1 的并行注意力架构。若追求更高画质和更多主体支持,可将这些模块集成到 Wan2.1-14B 或更大规模的 T2V 模型中,提升生成上限。
  3. 推理配置建议:每个主体提供的属性图片不宜超过 3 张(训练设定如此)。超参数 rr 建议先设为 0.5,这平衡了身份相似度和文本遵循度。推理时 CFG 尺度和步长可参考论文使用 6 和 50 步。
  4. 应对超多主体:当主体数远超训练分布(如 10 人以上),可尝试引入 NTK‑Aware Scaled RoPE 等训练免费的长度外推方法,增强位置编码的泛化性;同时应注意基础模型本身的多人生成能力,必要时可换用更强大的 T2V 骨干。
  5. 增强动态交互:当前的 MCAM 主要基于静态属性,若要支持挥手、握手等交互动作,可在数据标注阶段增加动作描述词,并在 MCAM 掩码中为运动相关文本 tokens 与视觉 tokens 之间建立更强的关联,这可能是后续优化的方向。