为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
论文信息
标题: Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
作者: Geo Ahn, Inwoong Lee, Taeoh Kim, et al.
发布日期: 2026-01-22
arXiv ID: 2601.16211v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:现有零样本组合动作识别(ZS-CAR)模型为何在未见过的动词–对象组合上表现不佳?论文发现核心失败模式是 “对象驱动的动词捷径”(object-driven verb shortcuts),即模型过度依赖对象线索来预测动词,而非学习动词本身的时序语义。
- 核心方法:提出 RCORE(Robust COmpositional REpresentations)框架,通过两项机制解决捷径问题——VOCAMix 是一种组合感知的数据增强方法,在不破坏时序结构的前提下生成新的动词–对象组合;TORC 是一种时序顺序正则化损失,强制模型区分正/反向时序语义并抑制对静态对象线索的依赖。
- 关键结果:在 Sth-com 数据集上,RCORE 首次在未见组合上实现正向的 Compositional Gap()(表 2),表明模型真正从组合推理中获益,而此前所有基线模型的该指标均为负值。
- 主要局限:论文仅在两个特定数据集(Sth-com 和 EK100-com)上验证,且 VOCAMix 依赖前景运动估计(FAME)的质量,在复杂背景下可能受限。
- 适合读者:从事视频理解、组合推理、捷径学习或零样本学习的计算机视觉研究者,以及关注模型鲁棒性的工程师。
论文背景和研究动机
零样本组合动作识别(Zero-Shot Compositional Action Recognition, ZS-CAR)要求模型正确识别训练时未出现的动词–对象组合。这一任务的核心挑战是:模型必须在组合空间极其稀疏的条件下,分别理解动词和对象的语义,并对其进行合理的组合推理。然而,已有方法在未见组合上始终表现不佳,原因何在?
本文通过系统诊断回答了这一关键问题。作者发现,ZS-CAR 模型失败的核心原因在于一种此前未被明确指出的失败模式——对象驱动的动词捷径。具体表现为:模型一旦识别出视频中的对象,就直接预测与之最常共现的动词,完全忽略视频中的时序运动证据。例如,看到 “抽屉” 就直接预测 “打开”,而不去真正观察动作是 “打开” 还是 “关闭”。这种捷径行为使模型退化为一个基于训练集共现统计的查找表,丧失了组合泛化能力。
论文进一步剖析了捷径行为产生的两个深层原因:
- 组合监督的稀疏性和偏斜性:在 Sth-com 和 EPIC-KITCHENS-100 数据集中,训练集覆盖的组合空间仅约 ,且分布极不均匀。某些动词–对象对大量出现,形成强共现先验。
- 动词与对象的学习难度不对称:对象可从单帧中轻松识别,而动词需要多帧时序推理。这种不对称性使得模型优先捕捉 “容易学习” 的对象线索,并将其作为预测动词的捷径。
这个问题之所以长期被忽视,与常用的评估协议有关。论文揭示了两种误导性实践:(1)闭集推理(closed-world inference),将预测空间限定在验证/测试集中出现的小子集,掩盖了模型过度预测常见组合的倾向;(2)使用测试集标签调优的偏差校准(bias calibration),人为抬高了未见组合的精度。为此,本文引入了开世界无偏评估协议和组合间隙(Compositional Gap, )指标:,正值表示组合建模相比独立的动词、对象预测带来了实际收益。
核心方法和技术细节
RCORE 框架包含两个核心组件,分别针对组合稀疏和不对称学习难度两大根因。
VOCAMix:组合感知的时空数据增强
为解决训练数据中动词–对象组合覆盖率极低的问题,VOCAMix 在不破坏原视频时序结构的前提下,合成新的动词–对象组合样本。给定一个主视频 (标签为 )和一个随机选择的视频 (对象标签为 ),VOCAMix 在时序维度上,将 的静态对象区域注入到 的运动前景区域:
这里 是基于帧差和颜色统计的无监督运动前景估计函数(来自 FAME 算法), 是帧索引, 控制对象注入强度。动词标签保持不变,确保生成样本的动词语义仍与原始视频一致。
与传统的 CutMix 或 Mixup 不同,VOCAMix 的关键设计在于:(1)仅在运动区域上进行混合,避免破坏物体的外观完整性;(2)沿时间轴注入一致的静态对象,保持时序线索不受破坏。消融实验(表 4c)显示,CutMix 和 Mixup 反而降低了模型性能,因为它们无法区分动词的时序差异和对象的静态特征。
TORC:时序顺序正则化损失
TORC 损失从两个层面强制模型学习时序敏感的动词表征:
1. 时序反转判别(): 将帧序列反转得到 ,通过最小化原始动词特征 与反转特征 的余弦相似度,迫使模型理解动作方向:
论文发现(图 5b),基线模型在这两个特征上的余弦相似度高达 ,表明它完全无法区分 “打开” 和 “关闭”;而 RCORE 将该值降至 ,成功习得了相反时序语义的判别能力。
2. 时序打乱高熵约束(): 对帧序列进行随机打乱 ,最大化此时模型在动词类别上的预测熵,抑制其在缺乏正常时序结构时做出自信的动词预测:
总损失为 。此外,RCORE 还引入了一个边界损失(Margin Loss),显式惩罚那些虽高频共现但实际错误的组合 logit 接近真实标签 logit 的程度,进一步抑制共现偏差。
总训练目标为:
其中 和 分别为组件级和组合级交叉熵损失。
创新点和贡献
1. 首次识别并系统诊断了 ZS-CAR 中的对象驱动捷径 论文通过一系列受控实验证实了这一失败模式:(1)在平衡的子集上,对象精度的增长速度远快于动词(图 2a);(2)在偏斜的训练集上,未见组合的对象精度上升时,未见组合的动词精度反而降至随机水平以下(图 2b);(3)SOTA 模型在未见组合上出现负的组合间隙 ,表明组合建模不仅无益,反而有害。
2. 揭示了主流评估协议的局限性 论文指出闭集推理和测试集偏置校准会掩盖模型的真实泛化能力,并引入了开世界评估和组合间隙指标作为更严格的诊断工具。
3. 提出了简单有效的 RCORE 框架 VOCAMix 和 TORC 的组合不仅优雅地解决了根因问题,而且实现简单,无需额外的计算开销或复杂架构。消融实验(表 4a)验证了各组件的协同效应:单独使用 TORC 相比于基线在未见动词精度上已有显著提升(),三者联合使用进一步将未见组合的谐波均值从 提升至 。
实验结果分析
在两个基准数据集上,RCORE 取得了全面一致的提升。
Sth-com 数据集(表 2):在开世界无偏评估下,RCORE 的未见组合精度达到 ,相比于 C2C 基线的 提升 个百分点。更重要的是,RCORE 是唯一在未见组合上获得正向组合间隙()的方法,所有基线方法均为负值。在闭集 H.M. 和 AUC 指标上也全面超越此前方法。
EK100-com 数据集(表 3):RCORE 在未见动词识别上取得了 的精度(基线 ),组合 H.M. 从 提升至 。在未见组合的组合间隙方面,RCORE 虽仍为负值(),但较基线()大幅收窄,表明其正在朝正向组合推理演进。
诊断指标分析(图 5a):在训练过程中,RCORE 的误共现预测比例(FCP)从 降至 ,而基线从 激增至 ,验证了其抑制共现偏差的有效性。
时序建模能力(图 5c):在 Sth-com 的 Temporal 子集上,RCORE 在使用打乱特征时性能下降幅度远大于基线,表明其动词表征确实高度依赖正常的时序结构,而非静态对象线索。论文还展示了六个代表性动词(如 “折叠/展开”、“打开/关闭”)的混淆矩阵(图 6),可视化证实 RCORE 成功分离了这些易混淆的相反语义对。
实践建议
本文提供了明确的工程落地指引,特别是对正在构建或优化组合视频理解系统的团队:
-
诊断现有系统:在部署任何 ZS-CAR 模型前,应计算组合间隙 和 FCP 指标,检验模型是否已退化为共现统计的依赖者。负的 是一个明确警示信号。
-
数据增强策略:在时序动作识别中,应避免使用破坏时序结构的图像域增强方法(如 CutMix、Mixup)。VOCAMix 的实践要点是:仅在空间上进行对象替换,保持时序轴的一致性,且使用简单的无监督运动检测器即可获得不错的效果。
-
训练技巧:
$L_{\cos}$和$L_{\text{ent}}$的组合可作为轻量级时序正则化模块,即插即用地嵌入到现有的动词编码器训练流程中。论文提供的消融实验表明:先从第 5 轮开始、线性递增至第 10 轮加载 TORC(表 9g),以及从第 15 轮开始加载边界损失(表 9h),是稳定的超参配置。 -
评估协议规范:建议从业者在论文报告和模型选型时,明确区分开世界与闭集评估,并在评估时不使用测试集标签调优偏置项。直接使用验证集调优偏置是公平比较的唯一方式。