UNIEGO:代理作为统一自我中心视频表征学习的中介者

arXiv: 2606.20559v1

论文信息

标题: UNIEGO: Proxies as Mediators for Unified Egocentric Video Representation Learning

作者: Wenhao Chi, Arkaprava Sinha, Dominick Reilly, et al.

发布日期: 2026-06-18

arXiv ID: 2606.20559v1

PDF 链接: 下载 PDF

研究背景与动机:以自我为中心视频理解的困境

在增强现实、辅助机器人和过程性活动分析等应用中,理解第一人称(以自我为中心)视频中的复杂人类行为至关重要。然而,可穿戴相机固有的局限性给这一任务带来了根本性挑战:狭窄的视野、频繁的自我遮挡使得演员的身体姿态和周围场景信息严重缺失。更关键的是,单一模态的输入(通常是 RGB 视频)抛弃了深度、骨骼等富含几何结构信息的互补模态;同时,那些蕴藏在大型基础模型中的丰富表征知识也未能得到有效利用。

现有的多教师知识蒸馏方法虽然尝试整合多源监督信号,但在以自我为中心的设定下面临两大结构性障碍。首先,教师模型之间存在严重的异质性:基于骨骼的模型采用面向图的神经网络架构,与视频编码器完全不兼容;而外中心视角的 RGB 教师则从完全不同的视角编码场景几何信息,形成了巨大的 “表征鸿沟”。其次,简单地强迫一个以自我为中心的学生模型同时调和这些互不兼容的特征空间,会导致冲突梯度信号,严重损害优化过程。

本文提出的核心论点是:一个真正富有表达力的以自我为中心的表示,必须能够融合跨视角、跨模态和跨基础模型的互补知识,但在推理时仅需依赖以自我为中心的视频输入。这一观点直接催生了 UNIEGO 框架的设计。

核心方法:分层代理中介蒸馏框架

UNIEGO 采用了一个两层级的层次化知识蒸馏策略,通过引入 “代理模型” 作为结构化中介,巧妙地化解了异质教师模型带来的挑战。

第一层级:代理学习(Proxy Learning)

在这一阶段,框架为每一个教师模型独立训练一个对应的代理模型。具体而言,对于给定的以自我为中心视频 xiex^e_i 及其同步的辅助输入 {xir}r=1R\{x^r_i\}^R_{r=1}(这些辅助输入可能来自不同视角或模态),通过 RR 个教师网络 {Tr}r=1R\{T_r\}^R_{r=1} 提取各自的特定表征 hir=Tr(xir)h^r_i = T_r(x^r_i)。每个代理模型 PrP_r 以学生架构 f()f(\cdot) 处理以自我为中心视频 xiex^e_i,产生特征嵌入 hih_i 和动作分类 logits ziz_i,并通过以下目标函数进行优化:

LrI=1Ni=1N(λIDcos(hi,hir)+λclsCE(zi,yi))L^I_r = \frac{1}{N}\sum_{i=1}^N \left(\lambda_I D_{cos}(h_i, h^r_i) + \lambda_{cls} CE(z_i, y_i)\right)

关键在于,尽管被截然不同的教师所引导,所有代理模型共享完全相同的以自我为中心的视频编码架构。这一设计将异质的教师监督信号统一转换到了一个同质的以自我为中心代理空间中,弥合了因教师架构和视角差异产生的表征鸿沟。实验中的中心核对齐分析证实,代理模型之间的表征相似度显著高于原始教师之间的相似度,这为第二层级的统一提供了稳固的基础。

第二层级:选择性代理蒸馏(SPD)

第二层级的目标是将所有代理模型的互补知识整合入统一的以自我为中心编码器 f(θU;)f(\theta_U; \cdot) 中。这一阶段包含两个紧密耦合的组件:

代理合并初始化(Proxy Merging Initialization) 为避免从一个随机的或有偏的起点开始蒸馏,UNIEGO 通过求解一个约束优化问题来获得最优初始参数:

θmerge=r=1Rαrθr,α=argminαΔR1Ni=1NCE(f(r=1Rαrθr;xie),yi)\theta^*_{merge} = \sum_{r=1}^R \alpha^*_r \theta_r, \quad \alpha^* = \arg\min_{\alpha \in \Delta^R} \frac{1}{N}\sum_{i=1}^N CE\left(f\left(\sum_{r=1}^R \alpha_r \theta_r; x^e_i\right), y_i\right)

根据延森不等式,在损失函数局部凸的假设下,这一合并初始化理论上保证了其分类损失不超过任何单个代理模型的损失。这种策略将统一模型置于损失景观中一个平坦、泛化性能更优的区域,为后续的选择性蒸馏提供了稳固的起点。

选择性代理蒸馏机制 SPD 的核心创新在于其对训练样本的动态样本级路由。对于每个训练样本 xiex^e_i,它首先构建一个可靠的候选代理集 Ci={r{1,...,R}y^ir=yi}C_i = \{r \in \{1,...,R\} \mid \hat{y}^r_i = y_i\},仅包含那些预测正确的代理模型。随后,根据交叉熵损失 sir=CE(zir,yi)s^r_i = CE(z^r_i, y_i) 对候选代理进行置信度排序,选择损失最低的 Top-K 个代理构成蒸馏集合 SiS_i。若没有代理预测正确(Ci=C_i = \emptyset),则完全跳过该样本的蒸馏,有效阻止了错误监督的传播。

蒸馏损失融合了特征级和 logits 级的监督:

LUdistill(i)=βfeatSijSiDcos(hiU,hiPj)+βlogitSijSiDKL(σ(ziPj)σ(ziU))L^{distill}_U(i) = \frac{\beta_{feat}}{|S_i|}\sum_{j \in S_i} D_{cos}(h^U_i, h^{P_j}_i) + \frac{\beta_{logit}}{|S_i|}\sum_{j \in S_i} D_{KL}\left(\sigma(z^{P_j}_i) \parallel \sigma(z^U_i)\right)

梯度冲突分析表明,直接多教师蒸馏面临严重的梯度干扰(冲突率达 60%-70%),而从所有代理均匀蒸馏将冲突率降至 42%-50%,SPD 则进一步优化至更低水平,实现了分类梯度与蒸馏梯度的协同优化。

实验成果与性能验证

UNIEGO 在三个具有挑战性的以自我为中心-外中心视频基准数据集上,跨越动作识别、视频检索和动作分割三大任务,全面验证了其有效性。

在动作识别任务中,UNIEGO 在 EgoExo-Fitness、Assembly101 和 EgoExo4D 上分别将基线 TimeSformer 性能提升了 4.4%、3.1% 和 1.2%,达到了当前最先进的水平。值得注意的是,在 EgoExo-Fitness 上的大幅提升反映了 SPD 机制的优势——当外中心代理(特别是骨骼和外中心 RGB 代理)提供强监督时,UNIEGO 能够有效利用这些信息来弥补以自我为中心视角的固有局限。

消融研究清晰地揭示了各组件不可或缺的贡献:单纯引入代理学习并均匀蒸馏带来 1.8% 和 1.1% 的提升;替换为 SPD 后额外获得 0.2% 的增益;而代理合并初始化的加入使最终性能跃升至 84.7% 和 50.7%,证明了三者之间的强协同效应。

在视频检索任务中,UNIEGO 提取的特征展现出更强的辨别力,尤其在 EgoExo-Fitness 上将 mAP 从 0.474 提升至 0.543。对于动作分割任务,UNIEGO 保留的细粒度时序结构使得所有评估指标均取得最佳结果,而朴素的均匀多教师蒸馏甚至损害了时序表征的完整性。

实践应用建议与未来方向

对于量化交易和人工智能领域的从业者,UNIEGO 的设计哲学提供了宝贵的借鉴:

  • 异构知识融合的代理中介思想:在多因子选股或市场状态识别中,来自基本面、技术面和情绪面的信号往往存在于异构的特征空间中。引入 “代理模型” 将不同来源的预测信号映射至统一的表示空间,再进行选择性整合,可以有效提升模型的稳健性。

  • 可靠性驱动的动态监督路由:SPD 的样本级教师选择机制可以迁移到在线学习场景中,根据市场波动率或新闻置信度动态调整不同数据源的权重,避免将噪声信号纳入模型训练。

  • 模型初始化的几何视角:代理合并初始化将模型置于泛化性能更优的损失景观区域,这一思想可以应用于深度学习模型的预训练策略设计,特别是在数据稀缺或标注噪声较多的场景下。

展望未来,UNIEGO 的代理选择机制目前基于一个启发式的小损失准则,尚未完全挖掘代理池的潜力。一个富有前景的研究方向是设计一个学习型选择机制——该机制能够根据输入内容和训练状态动态评估代理的可靠性权重,从而提供更丰富且自适应的监督信号。此外,将 UNIEGO 框架扩展至更大规模的基础模型集合、探索跨数据集的泛化能力,也是重要的后续课题。

总结与展望

UNIEGO 通过分层代理中介蒸馏框架,系统性地解决了在以自我为中心视频表征学习中整合跨视角、跨模态和跨基础模型知识时遇到的表征鸿沟与冲突梯度两大核心挑战。其核心洞见——通过代理模型将异质知识映射到统一空间,再以可靠性为导向进行选择性聚合——不仅为计算机视觉领域提供了新的技术范式,也为更广泛的机器学习应用场景中处理异构多源监督信号贡献了富有启发性的设计准则。这一工作不仅推进了以自我为中心视频理解的性能边界,更重要的是,它演示了如何以结构化、有原则的方式从多样化的知识源中构建统一且鲁棒的表示。