具有不确定性量化的可解释无人工标注深度学习用于真假分类
论文信息
标题: Interpretable Human-Label-Free Deep Learning for Real-Bogus Classification with Uncertainty Quantification
作者: Raphaël Bonnet-Guerrini, Bruno Sanchez, Dominique Fouchez, et al.
发布日期: 2026-07-06
arXiv ID: 2607.05393v1
PDF 链接: 下载 PDF
研究背景与动机:告别人工标注的天文瞬变源筛选难题
时域天文学已经进入大巡天时代,以薇拉·鲁宾天文台的 LSST 为代表的新一代巡天每晚会产生数百万条瞬变源候选体预警。这些预警绝大多数是伪迹——由图像相减残留、宇宙线、坏像素、大气变化等因素造成的虚假信号。在后续光谱跟踪资源极为有限的约束下,能否在单次探测层面就高效区分真实天体事件与伪迹,直接决定了瞬变源发现流水线的科学产出。
然而,当前主流的深度学习真伪分类器都建立在大量人工标注数据之上。人工审阅不仅成本高昂、速度缓慢,不同标注者之间的一致性也难以保证,更要命的是,标注标准与特定巡天的仪器特性高度耦合,从一个望远镜学到的模型往往无法直接迁移到另一个望远镜。这正是论文针对的核心痛点:能否在完全不依赖人工标签的情况下,训练出一个既准确又具备可靠不确定性估计的真伪分类器?
作者团队从物理直觉出发给出了一个巧妙答案:巡天的未标注探测结果天然以伪迹占绝对主导,而逼真的瞬变源则可以通过图像层面的物理注入来生成。于是真伪分类问题被重构为一个弱监督学习问题——我们把 “注入源” 当作(近乎)干净的真实类,把 “巡天探测” 当作包含大量真实瞬变源污染的噪声伪迹类,用带噪声标签的数据训练一个健壮的分类器。这正是该工作最根本的创新点。
核心方法:注入驱动的不对称协同教学与不确定性量化
从注入到训练:构建无人工标签的数据集
工作流程始于图像注入。研究使用斯巴鲁望远镜 HSC 巡天的 rc2_subset 数据作为训练基础。在图像层面,按照宿主星系的光度轮廓采样距离和方向,生成超新星类似子源的注入目录,其中还混入 10% 无寄主星系成分以避免位置偏差。注入源经过与真实巡天完全一致的差分图像分析流水线处理后,被成功恢复的信号作为 “真实类”,而所有巡天探测(无论真假)被赋予 “伪迹类” 标签。这种设计造成了一个有意的标签污染:训练集中伪迹类的确混杂着真实瞬变源。
为了系统评估方法在不同污染程度下的鲁棒性,研究构建了多组数据集,人为将一部分注入源标签翻转为伪迹,使伪迹类中的污染比例分别为 15%、25% 和 35%。这在概念上模拟了当巡天流水线改善、伪迹占比降低时,现有弱监督假设可能面临的挑战。
不对称协同教学:应对高度不平衡标签噪声
标准监督学习在面对这种不对称标签噪声时会迅速过拟合污染样本。论文改进了经典的协同教学(Co-teaching)方法,提出不对称协同教学(Asym-Co-teaching)。其原理如下:
同时训练两个结构相同但初始化不同的卷积神经网络。每个训练批次中,每个网络先根据样本损失进行排序,但不再像标准协同教学那样全局选取小损失样本,而是按类别分别选取。关键引入了一对类别特异的遗忘率参数 和 ,它们随时间线性增加至预设上限。对于注入类(真实类)设置极低的遗忘率(如 0.01),几乎不丢弃样本;对伪迹类设置较高的遗忘率(如 0.05~0.35,视污染程度而定),丢弃掉高损失、可能被错误标签的样本。每个网络使用对方网络选出的小损失样本更新参数。这种 “交叉教学+类感知遗忘” 的策略有效防止了模型将高损失真实瞬变源错误剔除,同时又能排除伪迹类中的标签噪声。
低成本不确定性量化:双网络+MC Dropout 的混合方案
科学决策要求模型不仅给出预测,还要提供校准良好的置信度。研究对比了深度集成、排斥集成、MC Dropout 等常见方法,并独创性地利用协同教学固有的双网络结构,结合 MC Dropout 构建混合不确定性估计器。
具体而言,训练好的两个网络被视为一个迷你集成(mini-ensemble)的两种模式,推理时为每个网络执行多次带有 dropout 的前向传播,将所有预测概率的平均值作为最终输出,方差作为认知不确定性。这种策略避免了训练几十个独立模型的巨大开销,同时在校准误差(ECE 仅 0.0375)、负对数似然和 Brier 分数上全面超越了包括 50 个模型的深度集成在内的基线。更重要的是,不确定性物理意义明确:与信噪比呈现显著负相关(Spearman ),与超新星距离峰值亮度的时间间隔正相关(),说明模型在信号微弱或光变曲线信息不足时自然地产生了更大的怀疑。
潜在空间可解释性分析
为了探究模型到底学到了什么,作者利用 UMAP 将网络倒数第二层的嵌入投影到二维平面。结果表明,真实类和伪迹类在潜在空间中形成两个明显分离的流形,分类不确定性集中在边界区域。更有趣的是,伪迹区域内自发地出现了多个子结构,对应着不同类型的减法残差(如偶极子状、负残差等),证明模型在无监督条件下就发现了伪迹的细分类别,这为后续设计更有针对性的伪迹模拟甚至主动数据清洗提供了线索。
实验结果:稳健性与面向光变曲线的扩展
弱监督学习实验表明,在基线数据集(无额外污染)上,不对称协同教学达到了 0.922 的准确率和 0.971 的 AUC,与有人工标签的监督学习不相上下。当污染率被人为提高到 35% 时,标准模型准确率骤降至 0.812、AUC 跌至 0.903,而不对称协同教学仍保持着 0.871 准确率和 0.950 的 AUC,展现出极强的抗噪能力。值得留意的是,该方法对超新星类和其他变源的召回率大致相当,说明注入的超新星类似子源训练出来的特征具有很好的泛化性。
将源级分类结果按天体(光变曲线)聚合后,论文在人工审定的评估集上仅产生两个误判,聚合准确率高达 99.35%。绝大多数天体的源级预测内部高度一致——75.8% 的光变曲线中超过 90% 的源被正确归类。时间维度上,距峰值亮度 50 天以外的超新星探测的不确定性翻倍,准确率降至 0.75,与不确定性量化指标相互印证。这些结果表明,单历元真伪概率完全可以支撑光变曲线的对象级筛选,且附带的不确定性可用于在后续光变曲线拟合中对可信度低的观测点进行降权。
实践应用与未来方向
这套方法的真正吸引力在于其极强的可移植性。面对 LSST 等未来巡天,只需重新运行注入+训练管线,使用该巡天特有的模板和仪器参数生成注入源,即可完全绕开耗时费力的跨巡天人工标注和领域适配调优。工程落地时的几个建议:
- 注入策略应与核心科学目标对齐。论文故意选择了超新星类注入,如果目标是太阳系小天体或活动星系核,则应定制相应的注入模型。
- 遗忘率设置可以利用标准训练过程中的误分类率作为先验,无需完全猜测;论文展示了利用训练集上的假阳性/假阴性分数来近似真实噪声水平的可行性。
- 潜在空间分析宜成为常规质量评价环节。交互式的 UMAP 可视化不仅可以帮助发现分类边界附近的模棱两可样本,还有可能揭示伪迹的子类型,为新望远镜调试提供反馈。
未来工作很可能沿几个方向发展:将不对称协同教学扩展至噪声率估计,即让模型从训练动态中自我推断各类的污染程度;尝试使用稀疏自编码器等机制解释性工具,在潜在空间中明确识别与伪迹亚型对应的可解释概念;以及在多巡天数据流中以联邦学习或持续学习范式实现无需中心化标注的增量式分类器进化。
总结
这篇工作为天文瞬变源真伪分类提供了一套端到端的免人工标签解决方案。它以物理注入产生可靠正例、利用巡天数据自带的反例加噪声,通过不对称协同教学遏制标签污染,再以低成本的混合不确定性量化赋予每个预测以科学判断所需的置信度。实验结果稳健,思路清晰,且天然适配即将到来的海量巡天数据流。对于任何需要在有限标注条件下部署深度学习模型的天文数据处理管道来说,这都是一份兼具理论启发和工程落地价值的参考。