为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition

arXiv: 2601.16211v1

论文信息

标题: Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition

作者: Geo Ahn, Inwoong Lee, Taeoh Kim, et al.

发布日期: 2026-01-22

arXiv ID: 2601.16211v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现有零样本组合动作识别(ZS-CAR)模型为何在未见过的动词–对象组合上表现不佳?论文发现核心失败模式是 “对象驱动的动词捷径”(object-driven verb shortcuts),即模型过度依赖对象线索来预测动词,而非学习动词本身的时序语义。
  • 核心方法:提出 RCORE(Robust COmpositional REpresentations)框架,通过两项机制解决捷径问题——VOCAMix 是一种组合感知的数据增强方法,在不破坏时序结构的前提下生成新的动词–对象组合;TORC 是一种时序顺序正则化损失,强制模型区分正/反向时序语义并抑制对静态对象线索的依赖。
  • 关键结果:在 Sth-com 数据集上,RCORE 首次在未见组合上实现正向的 Compositional Gap(ΔCG=+0.40\Delta_{\text{CG}}=+0.40)(表 2),表明模型真正从组合推理中获益,而此前所有基线模型的该指标均为负值。
  • 主要局限:论文仅在两个特定数据集(Sth-com 和 EK100-com)上验证,且 VOCAMix 依赖前景运动估计(FAME)的质量,在复杂背景下可能受限。
  • 适合读者:从事视频理解、组合推理、捷径学习或零样本学习的计算机视觉研究者,以及关注模型鲁棒性的工程师。

论文背景和研究动机

零样本组合动作识别(Zero-Shot Compositional Action Recognition, ZS-CAR)要求模型正确识别训练时未出现的动词–对象组合。这一任务的核心挑战是:模型必须在组合空间极其稀疏的条件下,分别理解动词和对象的语义,并对其进行合理的组合推理。然而,已有方法在未见组合上始终表现不佳,原因何在?

本文通过系统诊断回答了这一关键问题。作者发现,ZS-CAR 模型失败的核心原因在于一种此前未被明确指出的失败模式——对象驱动的动词捷径。具体表现为:模型一旦识别出视频中的对象,就直接预测与之最常共现的动词,完全忽略视频中的时序运动证据。例如,看到 “抽屉” 就直接预测 “打开”,而不去真正观察动作是 “打开” 还是 “关闭”。这种捷径行为使模型退化为一个基于训练集共现统计的查找表,丧失了组合泛化能力。

论文进一步剖析了捷径行为产生的两个深层原因:

  1. 组合监督的稀疏性和偏斜性:在 Sth-com 和 EPIC-KITCHENS-100 数据集中,训练集覆盖的组合空间仅约 14%14\%,且分布极不均匀。某些动词–对象对大量出现,形成强共现先验。
  2. 动词与对象的学习难度不对称:对象可从单帧中轻松识别,而动词需要多帧时序推理。这种不对称性使得模型优先捕捉 “容易学习” 的对象线索,并将其作为预测动词的捷径。

这个问题之所以长期被忽视,与常用的评估协议有关。论文揭示了两种误导性实践:(1)闭集推理(closed-world inference),将预测空间限定在验证/测试集中出现的小子集,掩盖了模型过度预测常见组合的倾向;(2)使用测试集标签调优的偏差校准(bias calibration),人为抬高了未见组合的精度。为此,本文引入了开世界无偏评估协议和组合间隙(Compositional Gap, ΔCG\Delta_{\text{CG}})指标:ΔCG=AccC−(AccV×AccO)\Delta_{\text{CG}} = \text{Acc}^C - (\text{Acc}^V \times \text{Acc}^O),正值表示组合建模相比独立的动词、对象预测带来了实际收益。

核心方法和技术细节

RCORE 框架包含两个核心组件,分别针对组合稀疏和不对称学习难度两大根因。

VOCAMix:组合感知的时空数据增强

为解决训练数据中动词–对象组合覆盖率极低的问题,VOCAMix 在不破坏原视频时序结构的前提下,合成新的动词–对象组合样本。给定一个主视频 Xi\mathbf{X}_i(标签为 (yiV,yiO)(\mathbf{y}_i^V, \mathbf{y}_i^O))和一个随机选择的视频 Xj\mathbf{X}_j(对象标签为 yjO\mathbf{y}_j^O),VOCAMix 在时序维度上,将 Xj\mathbf{X}_j 的静态对象区域注入到 Xi\mathbf{X}_i 的运动前景区域:

h(X^i(k,:))=(1−λ)h(Xi(k,:))+λh(Xj(⌊T/2⌋,:))h(\hat{\mathbf{X}}_i(k,:)) = (1-\lambda) h(\mathbf{X}_i(k,:)) + \lambda h(\mathbf{X}_j(\lfloor T/2\rfloor,:)) y~iO=(1−λ)yiO+λyjO\tilde{\mathbf{y}}^O_i = (1-\lambda) \mathbf{y}_i^O + \lambda \mathbf{y}_j^O

这里 h(⋅)h(\cdot) 是基于帧差和颜色统计的无监督运动前景估计函数(来自 FAME 算法),kk 是帧索引,λ\lambda 控制对象注入强度。动词标签保持不变,确保生成样本的动词语义仍与原始视频一致。

与传统的 CutMix 或 Mixup 不同,VOCAMix 的关键设计在于:(1)仅在运动区域上进行混合,避免破坏物体的外观完整性;(2)沿时间轴注入一致的静态对象,保持时序线索不受破坏。消融实验(表 4c)显示,CutMix 和 Mixup 反而降低了模型性能,因为它们无法区分动词的时序差异和对象的静态特征。

TORC:时序顺序正则化损失

TORC 损失从两个层面强制模型学习时序敏感的动词表征:

1. 时序反转判别(Lcos⁡L_{\cos}): 将帧序列反转得到 Frev=(fT,…,f1)\mathbf{F}_{\text{rev}} = (\mathbf{f}_T, \dots, \mathbf{f}_1),通过最小化原始动词特征 fV\mathbf{f}^V 与反转特征 frevV\mathbf{f}^V_{\text{rev}} 的余弦相似度,迫使模型理解动作方向:

Lcos⁡=cos⁡(fV,frevV)L_{\cos} = \cos(\mathbf{f}^V, \mathbf{f}^V_{\text{rev}})

论文发现(图 5b),基线模型在这两个特征上的余弦相似度高达 0.910.91,表明它完全无法区分 “打开” 和 “关闭”;而 RCORE 将该值降至 −0.73-0.73,成功习得了相反时序语义的判别能力。

2. 时序打乱高熵约束(LentL_{\text{ent}}): 对帧序列进行随机打乱 Fshuffled=π(F)\mathbf{F}_{\text{shuffled}} = \pi(\mathbf{F}),最大化此时模型在动词类别上的预测熵,抑制其在缺乏正常时序结构时做出自信的动词预测:

Lent=∑i=1∣YV∣pilog⁡piL_{\text{ent}} = \sum_{i=1}^{|\mathbb{Y}^V|} p_i \log p_i

总损失为 LTORC=Lcos⁡+LentL_{\text{TORC}} = L_{\cos} + L_{\text{ent}}。此外,RCORE 还引入了一个边界损失(Margin Loss),显式惩罚那些虽高频共现但实际错误的组合 logit 接近真实标签 logit 的程度,进一步抑制共现偏差。

总训练目标为:

Ltotal=αLcom+βLcomp+γLTORC+δLML_{\text{total}} = \alpha L_{\text{com}} + \beta L_{\text{comp}} + \gamma L_{\text{TORC}} + \delta L_M

其中 LcomL_{\text{com}} 和 LcompL_{\text{comp}} 分别为组件级和组合级交叉熵损失。

创新点和贡献

1. 首次识别并系统诊断了 ZS-CAR 中的对象驱动捷径 论文通过一系列受控实验证实了这一失败模式:(1)在平衡的子集上,对象精度的增长速度远快于动词(图 2a);(2)在偏斜的训练集上,未见组合的对象精度上升时,未见组合的动词精度反而降至随机水平以下(图 2b);(3)SOTA 模型在未见组合上出现负的组合间隙 ΔCG=−0.42\Delta_{\text{CG}} = -0.42,表明组合建模不仅无益,反而有害。

2. 揭示了主流评估协议的局限性 论文指出闭集推理和测试集偏置校准会掩盖模型的真实泛化能力,并引入了开世界评估和组合间隙指标作为更严格的诊断工具。

3. 提出了简单有效的 RCORE 框架 VOCAMix 和 TORC 的组合不仅优雅地解决了根因问题,而且实现简单,无需额外的计算开销或复杂架构。消融实验(表 4a)验证了各组件的协同效应:单独使用 TORC 相比于基线在未见动词精度上已有显著提升(54.36%→56.80%54.36\% \to 56.80\%),三者联合使用进一步将未见组合的谐波均值从 36.47%36.47\% 提升至 38.75%38.75\%。

实验结果分析

在两个基准数据集上,RCORE 取得了全面一致的提升。

Sth-com 数据集(表 2):在开世界无偏评估下,RCORE 的未见组合精度达到 32.23%32.23\%,相比于 C2C 基线的 30.08%30.08\% 提升 2.152.15 个百分点。更重要的是,RCORE 是唯一在未见组合上获得正向组合间隙(+0.40+0.40)的方法,所有基线方法均为负值。在闭集 H.M. 和 AUC 指标上也全面超越此前方法。

EK100-com 数据集(表 3):RCORE 在未见动词识别上取得了 52.07%52.07\% 的精度(基线 49.71%49.71\%),组合 H.M. 从 29.38%29.38\% 提升至 31.23%31.23\%。在未见组合的组合间隙方面,RCORE 虽仍为负值(−0.29-0.29),但较基线(−1.22-1.22)大幅收窄,表明其正在朝正向组合推理演进。

诊断指标分析(图 5a):在训练过程中,RCORE 的误共现预测比例(FCP)从 9%9\% 降至 8%8\%,而基线从 11%11\% 激增至 17%17\%,验证了其抑制共现偏差的有效性。

时序建模能力(图 5c):在 Sth-com 的 Temporal 子集上,RCORE 在使用打乱特征时性能下降幅度远大于基线,表明其动词表征确实高度依赖正常的时序结构,而非静态对象线索。论文还展示了六个代表性动词(如 “折叠/展开”、“打开/关闭”)的混淆矩阵(图 6),可视化证实 RCORE 成功分离了这些易混淆的相反语义对。

实践建议

本文提供了明确的工程落地指引,特别是对正在构建或优化组合视频理解系统的团队:

  1. 诊断现有系统:在部署任何 ZS-CAR 模型前,应计算组合间隙 ΔCG\Delta_{\text{CG}} 和 FCP 指标,检验模型是否已退化为共现统计的依赖者。负的 ΔCG\Delta_{\text{CG}} 是一个明确警示信号。

  2. 数据增强策略:在时序动作识别中,应避免使用破坏时序结构的图像域增强方法(如 CutMix、Mixup)。VOCAMix 的实践要点是:仅在空间上进行对象替换,保持时序轴的一致性,且使用简单的无监督运动检测器即可获得不错的效果。

  3. 训练技巧:$L_{\cos}$ 和 $L_{\text{ent}}$ 的组合可作为轻量级时序正则化模块,即插即用地嵌入到现有的动词编码器训练流程中。论文提供的消融实验表明:先从第 5 轮开始、线性递增至第 10 轮加载 TORC(表 9g),以及从第 15 轮开始加载边界损失(表 9h),是稳定的超参配置。

  4. 评估协议规范:建议从业者在论文报告和模型选型时,明确区分开世界与闭集评估,并在评估时不使用测试集标签调优偏置项。直接使用验证集调优偏置是公平比较的唯一方式。