可操控视觉表征
Steerable Visual Representations
论文信息
标题: Steerable Visual Representations
作者: Jona Ruthardt, Manu Gaur, Deva Ramanan, et al.
发布日期: 2026-04-02
arXiv ID: 2604.02327v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何赋予预训练视觉模型(如 DINOv2)一种能力,使其能根据自然语言提示,灵活地将注意力从图像中最显著的对象转移到用户指定的任意概念上,同时不损害原始视觉表示的质量。
- 核心方法:提出 SteerViT 框架,在冻结的视觉编码器(ViT)内部插入轻量级的门控交叉注意力层,实现文本对视觉特征的 “早期融合” 式操控,并通过一个指代分割任务进行训练。
- 关键结果:SteerViT 在实现高度文本可操控性的同时,完全保留了底层视觉模型的表示质量,仅增加了约 2100 万个可训练参数,在各项任务上达到了帕累托最优(见图 2)。
- 主要局限:论文未明确讨论模型在处理非常长或非常复杂的文本提示、以及面对多轮对话式操控时的表现。其对特定视觉编码器(如 DINOv2)的强依赖性也是一个潜在局限。
- 适合读者:对视觉-语言模型、表征学习、具身智能、多模态交互以及任何希望以更灵活方式利用预训练视觉特征的研究者和工程师都具有重要参考价值。
论文背景和研究动机
预训练的视觉 Transformer(ViT),如 DINOv2、MAE 和 SigLIP,为图像分类、检索、分割等下游任务提供了强大的通用视觉特征。然而,这些模型本质上是以 “查询无关” 的方式工作,其特征编码不可避免地偏向于摄影师偏见和现有数据集中的对象中心性,即总是不由自主地关注图像中最显著的物体(如一只猫),而忽略了用户可能感兴趣的其他概念(如一个遥控器或书架)。
与此同时,多模态大语言模型(MLLMs)可以通过文本提示进行引导,但其产生的视觉特征往往以语言为中心,在通用的纯视觉任务上表现出较弱的视觉保真度和可控性,且模型参数规模通常达到数十亿级别。现有的其他视觉-语言模型,如 CLIP,大多采用 “晚期融合” 策略,即在视觉编码完成后才与文本进行交互,这意味着文本无法在推理时影响视觉特征的提取过程。
本文提出的根本问题在于:能否构建一类全新的视觉表示,使其既保留预训练 ViT 强大的通用视觉能力,又能像 MLLM 一样被自然语言灵活操控?
作者认为,与现有范式不同,应该将语言作为条件来操控视觉编码过程,而不是将视觉作为条件输入到语言模型中。这种 “视觉中心” 的多模态表示,有望打破现有方法在可操控性和表示质量之间固有的权衡。
核心方法和技术细节
SteerViT 的核心思想是在一个冻结的预训练视觉编码器内部,注入轻量级的、可训练的交叉注意力层,从而实现文本对视觉特征的 “早期融合” 式操控(见论文图 4)。该框架包含四个关键组件:
A. 冻结的视觉和文本编码器:视觉编码器(如 DINOv2 ViT-B/14)和文本编码器(如 RoBERTa-Large)的参数在训练过程中完全冻结,最大限度地保留预训练知识。
B. 多模态适配器:一个可训练的两层 MLP 将文本编码器输出的词元嵌入映射到与视觉特征对齐的嵌入空间。
C. 门控交叉注意力层:这是实现 “操控” 的关键。该模块被插入到 ViT 的每两个 Transformer 块之间(例如,12 个 ViT-B 块共有 6 个交叉注意力层)。与将语言特征融入视觉的常规做法不同,SteerViT 反转了 Flamingo 的架构:它让视觉 patch 词元作为查询(Query),去关注经过适配的文本词元(作为 Key 和 Value)。公式如下:
其输出通过一个以 tanh 函数门控的残差连接集成到 ViT 的主干中:
门控标量参数 初始化为 0,意味着模型在初始状态与原始 ViT 完全一致。由于 ,训练开始时梯度可以流畅地流过,使得 能逐渐学习到一个非零值,从而平滑地激活文本操控通路。
D. 训练目标与数据:为了迫使 ViT 利用文本信息,论文设计了一个简单的代理任务——基于图像块(patch)的指代分割。给定图像和描述某个对象的文本,模型需要通过一个线性头部预测哪些图像块属于所指对象。训练使用软交叉熵损失。这比用边界框中心点进行 “指点” 训练效果更佳,因为它迫使模型学习对象的外观和范围(见表 8 消融实验)。训练数据混合了 RefCOCO 系列、Visual Genome、LVIS 和 Mapillary Vistas 等涵盖多种视觉域和文本风格的指代分割数据集,总计约 16.2 万张独特图像和 228 万个图像-文本对。
创新点和贡献
1. 提出 “可操控视觉表示” 这一新范式 SteerViT 首次系统性地定义并实现了一类满足三大需求的视觉表示:(1) 可操控性,(2) 高质量的表示,(3) 早期视觉-语言融合(见表 1)。它颠覆了 MLLM 将视觉融入语言的范式,而是在视觉编码器内部实现以视觉为中心的多模态融合。
2. 高效且普适的架构设计 该框架可以适配于任何预训练的 ViT(如 DINOv2、SigLIP、MAE 均得到验证),仅新增约 2100 万个参数,两个数量级小于 MLLM。门控交叉注意力机制不仅在训练时提供稳定性,还在推理时成为了一个天然的控制旋钮:通过缩放门控因子 ,用户可以平滑地在原始视觉特征和完全文本操控特征之间进行调节(见图 7)。
3. 揭示了文本对视觉特征粒度和空间的操控能力 论文通过一系列深入实验表明,文本提示的具体程度能够动态控制特征的语义粒度:从粗糙的类别到精细的实例外观(见图 8)。更重要的是,SteerViT 可以根据文本重新组织其嵌入空间的拓扑结构,既可以沿着语义层次(如 “动物” vs “非动物”)进行操控,也可以根据组合属性(如 “有眼睛” vs “无眼睛”)进行聚类,展现出超越其训练任务的涌现行为(见图 9)。
实验结果分析
论文通过多维度基准测试,系统验证了 SteerViT 的性能,实现了可操控性和表示质量的帕累托最优。
COnditional REtrieval (CORE) 基准上的可操控性:CORE 是一个精心设计的基准,用于衡量模型根据提示从同场景图像中检索特定对象的能力。实验结果显示,标准编码器 DINOv2 和 MAE 的 top-1 准确率仅为 44% 和 20%,因为它们无条件地偏向场景级显著性特征。SteerViT 则达到了 96% 的准确率(见论文第 4.1 节),相比 DINOv2 提升了 52.3 个百分点。即使与具备数十亿参数的 MLLM(如 InternVL3-1B)相比,也大幅领先 49 个百分点,证明了早期融合策略的巨大优势。同时,其性能也与专门的开放词汇定位模型 SAM3 并驾齐驱。
表示质量的无损保留:在 ImageWoof、StanfordCars 等细粒度分类任务和 ADE20k 分割任务上,SteerViT 的线性探测准确率不仅没有下降,甚至在最佳门控点()时可以略微超越其骨架 DINOv2。相比之下,SAM3 等模型的中间特征在这些通用视觉任务上表现较差(见图 2)。这证实了 SteerViT 是第一个在不牺牲原有表示质量的前提下实现文本操控的模型。
零样本与少样本泛化能力:尽管仅在包含通用对象的指代分割数据上训练,SteerViT 展现出了强大的零样本域外泛化能力。在工业异常检测 MVTec AD 数据集上,无需任何微调,其 PRO 指标达到了 82.1,与专门的零样本方法(如 FADE 的 84.5)性能相近,且远超 SAM3(54.5)和 CLIPseg(34.6)等分割模型(见图 11)。在个性化对象判别(PODS)任务中,通过提供精细的文本描述,其性能甚至可以超越在合成数据上进行了对象特定微调的专用 DINOv2 模型(PR-AUC 58.1% vs 48.0%)(见图 8)。
实践建议
SteerViT 作为一种创新的多模态特征提取器,具有明确的工程落地潜力,特别是在需要灵活、零样本地将语义理解注入视觉任务的场景中。
1. 作为即插即用的通用视觉特征提取器 目前在视觉任务中广泛使用的 DINOv2 特征可以被 SteerViT 直接替代,且能力有增无减。在实现时,只需加载论文发布的模型权重(或自行按方法训练),即可在处理复杂场景时,通过传入简单的文本提示(如 “a backpack”)来获取特定于该概念的全局图像特征和局部 patch 特征,用于后续的检索、分类或分割任务。这种 “一次提取、处处使用” 的模式非常契合现有大多数以视觉特征为基础的下游系统。
2. 在具身智能和机器人视觉中实现任务导向的感知 机器人在执行任务(如 “去拿那个红苹果”)时,其视觉系统需要能忽略场景中大量的干扰物(如桌上的杯子、墙上的钟)。SteerViT 的早期视觉-语言融合机制天生适合这种场景。开发者可以将任务指令直接作为文本提示输入 SteerViT,得到的操控后视觉表示将自然地突出与任务相关的物体和区域,为后续的导航、抓取等规划模块提供高度相关的场景理解,显著降低决策噪声。
3. 构建高效、可控的多模态检索系统 在电商 “以图搜图” 或相册管理中,用户常有细粒度检索需求(如 “找和我这双鞋同款,但是蓝色的”)。利用 SteerViT,系统可以无需为每种搜索属性(如颜色、款式、品牌)训练专用模型或构建复杂的属性解耦机制。只需在编码库图像和查询图像时,统一配上相应的精细文本描述,SteerViT 就能动态地重新组织特征空间,使得相似性的度量紧扣文本指定的属性,实现零样本的细粒度检索能力。推理时,调节门控因子 可以平衡通用视觉外观和特定属性的重要性,以适应不同模糊度的查询。