从噪声和不完整数据中进行的自监督学习
Self-Supervised Learning from Noisy and Incomplete Data
论文信息
标题: Self-Supervised Learning from Noisy and Incomplete Data
作者: Julián Tachella, Mike Davies
发布日期: 2026-01-06
arXiv ID: 2601.03244v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决什么问题? 论文系统性地研究了如何在只有带噪声或不完整的测量数据、没有干净参考信号(ground truth)的情况下,训练神经网络来求解反问题(inverse problems),例如图像去噪、修复、超分辨率和医学图像重建。
-
核心方法:用什么办法解决? 通过构建仅依赖测量数据的自监督损失函数(self-supervised loss),替代传统需要干净数据的有监督损失。方法包括利用独立噪声对(Noise2Noise)、在测量中重采样生成合成噪声对(Recorrupted2Recorrupted)、基于统计估计的 Stein 无偏风险估计(SURE)以及交叉验证式的盲点网络或拆分策略。
-
关键结果:最重要的一个结论或数字是什么? 在噪声分布完全已知的情况下,自监督损失可以无偏地估计有监督损失,理论上能够学到与有监督学习同等的最优重建器(条件均值估计器)。即使噪声分布部分未知,通过适度约束重建函数,性能下降也可控。
-
主要局限:作者自己承认的、或方法本身固有的限制。 当噪声分布完全未知时,需要施加较强的函数空间约束(如盲点网络),导致最优性损失依赖于信号的空间相关性。对于不可逆的正向算子(如欠采样测量),仅靠测量一致性无法学习,需要额外的多算子或变换等变性假设。
-
适合读者:什么背景的人值得读。 适合从事计算成像、医学图像重建、计算机视觉反问题,并对自监督学习、逆问题理论、统计估计有研究兴趣的工程师、研究人员和学生。
论文背景和研究动机
在科学和工程中,大量反问题需要从噪声或不完整观测中推断原始信号。传统方法依赖于手工设计的正则化项(如稀疏性、全变分),虽具有理论保证但难以捕捉复杂信号结构。深度学习的兴起带来了数据驱动的重建方法:通过配对的地面真值信号与测量数据,直接学习从测量到信号的映射。有监督学习在加速磁共振成像、计算显微镜等任务中取得了显著优于传统方法的性能(例如在加速 MRI 中将峰值信噪比提升约 6 dB)。
然而,这一范式存在根本局限:在许多真实场景(如医学成像、天文成像)中,获取大量成对的地面真值数据极其昂贵甚至不可能。模拟数据虽可无限生成,但无法完全建模真实环境的复杂噪声与统计特性。此外,有监督模型对训练与测试分布之间的偏移(distribution shift)非常敏感。
这些挑战推动了对自监督学习方法的研究:仅利用测量数据本身,结合已知的采集物理模型(正向算子),训练重建网络。论文从这个动机出发,全面总结了近年来自监督逆问题求解方法的理论基础和实际应用。
核心方法和技术细节
论文首先将反问题形式化为:给定测量 ,其中 为正向算子, 为噪声,目标是学习 。有监督方法最小化 ,其最优解为条件均值 。自监督学习的核心是构造一个仅依赖于 的损失函数 ,使其在期望上与有监督损失等价或共享最优点。
论文系统性地将自监督损失分为三类:
1. 无偏损失 最理想的情况是自监督损失是监督损失的无偏估计。当可获取同一底层信号的两个独立噪声观测 时,Noise2Noise 损失 在条件独立且目标均值无偏的条件下,其条件期望等于监督损失加常数(命题 2.1)。
若仅有单个噪声观测但噪声分布完全已知,Recorrupted2Recorrupted 方法通过向 添加合成噪声,生成条件独立对 (命题 2.2,原理利用噪声协方差匹配),从而可利用 Noise2Noise 的策略。该方法被推广到整族自然指数分布族(如泊松、伽马噪声),通过特定分布的重采样实现(定理 2.3,表 2.1)。
另一个经典方法是 Stein 无偏风险估计(SURE),利用 Stein 引理(引理 2.4)将噪声与预测的相关项转化为网络散度项,得到损失 ,同样是监督损失的无偏估计。
2. 约束无偏损失 当噪声分布部分未知(如只知道噪声为高斯但不知方差),SURE 中的散度项无法直接计算。论文引入 UNSURE 框架:将噪声水平视为待优化的 Lagrange 乘子,在约束 下优化测量一致性项。命题 2.7 给出闭式最优解 ,并证明性能损失为 的高阶项,在信噪比提升显著时()非常小(公式 2.18)。
当噪声分布完全未知,仅知道像素间独立时,需采用更强的交叉验证约束:,即每个输出像素不依赖其对应输入像素。这可通过盲点架构(屏蔽中心像素)或输入拆分掩码(如 Noise2Void、Neighbor2Neighbor)实现。这类约束让优化的目标变为 ,其与真实后验均值的差距依赖于信号的空间相关性。
3. 多算子和变换等变性 当正向算子不可逆(存在零空间)时,即使无噪声,仅用测量一致性也无法唯一确定信号(命题 3.1)。论文介绍了两种补充信息策略:使用多个不同正向算子采集的数据,通过拆分损失让网络预测未观测部分(命题 3.2);或假定信号分布具有变换等变性(如图像平移),通过等变性约束和算子结构配对构建自监督损失。
创新点和贡献
本论文的主要贡献在于提供一个系统化、理论自洽的自监督逆问题学习框架。其创新点体现在:
-
损失设计的层次化统一:将 Noisier2Noise、Recorrupted2Recorrupted、SURE/PURE、UNSURE、盲点网络及拆分方法统一在 “无偏-约束-共享最优解” 的渐进框架下,清晰揭示了知识是否充足对性能界限的影响关系(图 2.1)。
-
理论等价性的揭示:论文证明 Recorrupted2Recorrupted 在极限 下等价于 SURE 的蒙特卡洛近似(命题 2.6),并揭示了通过 Tweedie 公式将去噪与评分函数(score)估计联系起来的强对偶关系。
-
非高斯噪声与多算子的扩展:将重采样策略推广到自然指数分布族,给出了泊松、伽马噪声下的具体采样公式;将自监督学习从去噪推广到含零空间的线性逆问题,阐明了算子多样性与信号可恢复性的条件。
-
闭式性能损失分析:对 UNSURE 和交叉验证方法,推导了最优约束解及其相对于全监督最优解的误差上界,为实际应用中的模型设计提供理论指导。
局限与待解决问题
尽管论文较为全面地总结了既有成果,但仍存在若干显式或隐含的局限:
-
对噪声模型的依赖性:所得结论高度依赖 “噪声期望为信号” 的均值无偏假设。对存在系统偏差或非零中位数的噪声,论文中多数损失将失效或产生可控的未知偏置。
-
有限样本及高维效应:论文大部分分析基于无限数据期望,只在第 4 章提及有限样本挑战。对于高维反问题,交叉验证类方法(如盲点网络)可能因空间维度高而需要过强的先验约束,实际性能下界难以封闭计算。
-
非线性正问题与物理先验的深度结合:大多数理论针对线性算子。对于相位恢复、反散射等强非线性正问题,论文仅给出模型定义,未给出对应可操作的自监督损失设计原则。
-
评测指标单一:论文以 损失和条件均值为核心目标,未充分讨论感知质量指标、后验方差估计或不确定性量化。在多医学应用中,逐像素均方误差与临床诊断需求之间存在已知鸿沟。
-
对真实复杂系统的试验验证不足:论文主要回顾已发表方法的理论属性,缺乏在真实硬件噪声、生物组织散射或多模态分布偏移下的系统性实验对比,难以直接推断各方法在实际部署中的鲁棒性排序。
综合来看,本论文为自监督反问题重建提供了一套有深度的理论工具箱,但在实际复杂物理系统、稀缺样本学习以及更通用损失设计方面仍留有广泛的研究空间。