SOTAlign:通过最优传输实现单模态视觉与语言模型的半监督对齐

SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport

arXiv: 2602.23353v1

论文信息

标题: SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport

作者: Simon Roschmann, Paul Krzakala, Sonia Mazelet, et al.

发布日期: 2026-02-26

arXiv ID: 2602.23353v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文研究如何在仅有少量配对图像-文本数据的情况下,利用大量未配对数据来实现视觉和语言模型的跨模态对齐。
  • 核心方法:作者提出 SOTAlign,一个两阶段半监督框架:先用少量配对数据训练线性教师模型来恢复粗略的共享几何结构,再利用基于最优传输的散度在未配对数据上优化对齐层。
  • 关键结果:在仅使用 10k 配对样本和 1M 未配对样本的条件下,SOTAlign 在 COCO 零样本检索上达到 30.3% 的 MeanR@1,显著优于监督基线 SAIL 的 24.2%(见论文表 1)。
  • 主要局限:当配对样本极其稀少时(如 100 对),所有方法均失效;论文未探索在更大规模未配对数据(>1M)下的扩展性。
  • 适合读者:从事多模态学习、表示对齐、半监督学习或资源受限场景下模型部署的研究者与工程师。

论文背景和研究动机

当前,以 CLIP 和 ALIGN 为代表的视觉-语言模型依赖大规模配对数据进行对比学习。CLIP 使用了 4 亿对图文数据,ALIGN 则利用了 18 亿对,而最新模型如 SigLIPv2 的训练数据量更达到 100 亿张图像和 120 亿条替代文本。虽然模型性能随数据规模可预测地提升,但这种对海量配对数据的依赖使模型训练成本高昂,且在许多专业领域(如医学影像、工业检测、特定科学数据集)根本不可行。

柏拉图表示假说为这一问题提供了新的思路。该假说认为,在不同模态上训练的神经网络倾向于收敛到一个共享的统计模型。如果这一假说成立,那么预训练的单模态模型应该已经在语义层面产生了可对齐的表示,无需从头进行大规模的跨模态训练。

论文正是在这一背景下,探索了视觉-语言对齐的 “低监督” 极限:能否仅用极少量配对样本(如 10k 对)加上大量易得的单模态数据,就实现有意义的跨模态对齐?这不仅是理论探索,也直接对应了现实中配对数据昂贵、单模态数据丰富的实际场景。此前的工作要么依赖成百上千万对配对数据,要么在无监督尝试中受限于方法不可扩展(如仅能处理数百个样本的二次分配问题求解器)。SOTAlign 的提出正是为了突破这些限制。

核心方法和技术细节

SOTAlign 采用了一个简洁高效的两阶段框架,整个流程如算法 1 所述。

第一阶段:线性教师模型

首先,利用少量配对数据 (A,B)(A, B) 拟合一个线性对齐模型。论文尝试了三种线性方法:正交 Procrustes 对齐(寻找使配对数据在共享空间中最大相关的一对正交变换)、典型相关分析(CCA,寻找最大相关方向,但对变换后而非变换本身施加正交约束)和线性对比学习(直接使用 SigLIP 损失训练线性投影)。这三种方法都能在仅 10k 配对样本上产生令人惊讶的对齐效果(CCA 达到 21.5% 的 MeanR@1,对比学习方法达到 24.2%,见表 1)。这一发现本身就为柏拉图表示假说提供了经验支持。

所得线性投影记为 WxW_x 和 WyW_y,它们将作为第二阶段训练的 “教师信号”。

第二阶段:最优传输散度与对齐层优化

第二阶段的核心是用线性教师模型生成的目标亲和力矩阵来正则化可训练的对齐层 fθ1f_{\theta_1} 和 gθ2g_{\theta_2} 的学习。此时,训练数据包括少量配对样本和大量未配对图像 XX 和文本 YY。

训练损失为:

Lα=L(θ;A,B)+αΩ(θ;X,Y)\mathcal{L}_{\alpha} = \mathcal{L}(\theta; A,B) + \alpha\Omega(\theta; X,Y)

其中,L(θ;A,B)\mathcal{L}(\theta; A,B) 是标准的 SigLIP 对比损失,而正则项 Ω\Omega 要求可训练模型在未配对数据上产生的亲和力矩阵 K[f(X),g(Y)]K[f(X), g(Y)] 与线性教师模型产生的 K[XWxT,YWyT]K[XW_x^T, YW_y^T] 保持一致。

正则项中散度的选择是论文的核心贡献之一。作者提出了 KLOT 散度:

KLOT(K∣∣K∗)=KL(OTϵ∗(K∗) ∥ OTϵ(K))\text{KLOT}(K || K^*) = \text{KL}\left(\text{OT}_{\epsilon^*}(K^*) \,\middle\|\, \text{OT}_{\epsilon}(K)\right)

这里 OTϵ(K)\text{OT}_{\epsilon}(K) 是以 KK 为亲和力矩阵、熵正则化参数为 ϵ\epsilon 的最优传输计划。与 Softmax 只保留近邻不同,最优传输保持了全局的匹配关系。更重要的是,论文推导出了 KLOT 散度对 KK 的显式梯度(定理 5.1):

∇KKLOT(K∣∣K∗)=OTϵ(K)−OTϵ∗(K∗)ϵ∗\nabla_K \text{KLOT}(K || K^*) = \frac{\text{OT}_{\epsilon}(K) - \text{OT}_{\epsilon^*}(K^*)}{\epsilon^*}

这一公式的意义在于:计算梯度不再需要展开 Sinkhorn 迭代步骤进行反向传播,从而消除了此前最优传输方法面临的内存瓶颈。实验表明,在批大小为 10k 时,显式梯度方法比展开 Sinkhorn 迭代节省了高达 50 倍的内存(图 3),比隐式微分方法快了 50 倍(图 6)。

创新点和贡献

论文的创新点集中体现在三个方面。

首先,它证明了在有监督样本极度匮乏的情况下(10k 对),仅使用线性模型就能恢复出有一定质量的跨模态对齐。CCA 方法不需要任何训练,只要求解一个闭式解就能达到 21.5% 的检索性能(表 1),这为柏拉图表示假说提供了有力的经验证据。

其次,论文提出了 KLOT 散度,这是对 InfoNCE 损失从最优传输视角的自然扩展。InfoNCE 实际上是将对比目标视为一种 “硬” 匹配(只保留最近邻),而 KLOT 则保持了完整的传输计划,从而传递了更丰富的结构化信息。这种扩展在理论和实践上都很有价值。

最重要的是,定理 5.1 完全解决了基于最优传输的对齐方法长期以来面临的可扩展性问题。通过给出闭式梯度表达式,SOTAlign 可以处理大得多的批数据(实验中达到 32k),而不需要付出昂贵的内存或计算代价。这一结果的影响超越了本论文本身,可推广到 “一系列使用类似目标的 OT 基方法”。

实验结果分析

论文进行了全面的实验评估,核心发现包括:

在消融实验中,KLOT 散度系统性地优于其他散度。 无论使用何种线性教师模型,KLOT 都取得了最好的下游性能(见表 1)。当 CCA 作为线性教师、KLOT 作为散度时,SOTAlign 达到了 30.3% 的 MeanR@1,比最好的监督基线高出了 6.1 个百分点。

SOTAlign 能以约 4 倍少的监督达到与全监督方法相同的性能。 在固定 1M 未配对样本的条件下,SOTAlign 在配对样本较少时带来最大幅度的增益(中点区域获得高达 +10% 的提升,图 4 左)。随着配对样本增多,增益逐渐减小,这是符合预期的。当配对样本增加到 100k 时,两者的性能接近。SOTAlign 在使用约四分之一的监督量时即可达到 SAIL 的全监督性能。

充足但不过量的未配对数据对性能提升最为有效。 研究显示,从 10k 到 500k 未配对样本,性能持续提升,此后趋于饱和(图 4 右)。论文还揭示了有趣的现象:未配对数据源的分布偏移度与性能增益呈强负相关。使用球形切片 Wasserstein 距离量化分布偏移后,论文发现分布越接近配对数据,性能增益越大(图 5)。这意味着在实际应用中,选择与配对数据分布相近的未配对数据更为有效。

在半监督对齐基准测试中,SOTAlign 是唯一能有效利用未配对数据的方法。 与其他半监督方法(SAIL 的负样本扩展、STRUCTURE、NNCLR、S-CLIP)相比,只有 SOTAlign 成功地从未配对数据中获益。在 COCO 零样本检索上,SOTAlign 达到 26.5% T2I R@1 和 34.1% I2T R@1,比最佳基线 STRUCTURE 高出超过 5 个百分点(表 4);在 ImageNet 零样本分类上达到 46.1% top-1 准确率,比最佳基线高出 7.9 个百分点(表 5)。所有其他半监督方法甚至无法超越纯监督基线。

跨数据集泛化能力较强。 当使用 ImageNet 图像和 CC3M 文本作为未配对数据(两个数据集来源完全不同)时,SOTAlign 仍能提高 COCO 检索性能(表 7)。在使用长文本合成描述的配对数据上,性能进一步提升,T2I R@1 提高了 4.8%。

实践建议

对于需要在资源受限条件下构建视觉-语言对齐模型的实践者,SOTAlign 提供了一条可行的路径。以下建议基于论文的实验发现:

选择预训练编码器时,优先考虑在大规模数据上训练的模型。 DINOv3 ViT-L(1.7B 图像训练)与 NV-Embed-v2 的组合比 DINOv2 ViT-L(142M 图像训练)的组合性能高出 3-4 个百分点(表 3)。这说明编码器的训练规模越大,表示空间越趋于收敛,对齐难度越低。

线性教师模型的选择有明显影响。 在实践中,如果只使用闭式解方法(CCA 或 Procrustes),应优先选择 CCA(21.5% vs 21.1%,表 1)。如果可以增加计算成本,线性对比学习方法(达到 24.2%)会是更好的起点。考虑到实现的简便性,CCA 是前期快速实验的理想选择。

未配对数据的质量比数量更重要,来源接近配对数据的未配对数据更有效。 当使用 COCO 文本作为未配对数据时,检索性能显著提升;而使用 WikiText103 文本(风格差异较大)时,增益相对更小(表 7)。图 5 中 SSW 距离与性能的强相关性表明,可以通过计算距离来预估特定未配对数据源的潜在价值,从而避免盲目的数据收集。

在处理极少量配对数据(<1k 对)的场景时,不要对 SOTAlign 抱有不切实际的期望。 图 4 清楚地显示,当配对样本降至 100 对时,所有方法均失效。对于这种极端低资源场景,需要探索其他方法或接受性能的大幅下降。在 1k-10k 对的范围内,SOTAlign 的半监督能力最为显著。

实现时注意内存效率。 对于大规模应用,应直接计算 KLOT 的闭式梯度,而不是通过 Sinkhorn 迭代展开。在论文提供的实现中,对于 10k 批数据,闭式梯度仅占用不到 1GB 内存,而展开 Sinkhorn 需要超过 45GB 内存(图 3)。这使得在单张消费级 GPU 上训练更大的批尺寸成为可能。