解码过去:一种面向史前手印模性别归属的不确定性感知深度学习框架
Decoding the Past: An Uncertainty-Aware Deep Learning Framework for Sex Attribution in Prehistoric Hand Stencils
论文信息
标题: Decoding the Past: An Uncertainty-Aware Deep Learning Framework for Sex Attribution in Prehistoric Hand Stencils
作者: Karel Becerra, Boris Mederos, Dean Snow, et al.
发布日期: 2026-08-14
arXiv ID: 2608.14539v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决旧石器时代手印的作者生物学性别归属问题,尤其是在缺乏真值、图像退化和跨人群差异下如何给出可靠推断。
- 核心方法:用 “不确定性感知” 深度学习流水线,通过双图像/双轮廓、12 种剪影变体、两个深度模型集成(EfficientNet-B3 与 MobileViT-S)以及 UMAP + k-NN 和 LayerCAM 三种证据进行三角验证。
- 关键结果:在当代测试集的 [12–19] 岁年龄组中,EfficientNet-B3 集成(sum 聚合)准确率达到 88.4%(表 3)。
- 主要局限:作者明确承认,现代参考人群与旧石器时代晚期人群的手部形态分布差异未知,结果只能视为概率推断而非确定性判定(第 5 节)。
- 适合读者:从事考古数字人文、计算机视觉、深度学习不确定性量化,或文化遗产人工智能的研究者与工程师。
论文背景和研究动机
手印、手部阴印是旧石器时代洞穴艺术中最常见的形式之一,被一些研究者视为个人签名、仪式标记或群体凝聚的象征。过去几十年,研究者尝试用手长、指长、2D:4D 比值等形态计量学特征推断创作者性别,但传统方法存在明显局限:两性手部尺寸高度重叠、不同现代人群之间泛化差,而且手工特征选择依赖主观经验。论文指出,仅依赖尺寸和比例的方法在考古样本上的准确率常只有 60–65% 左右(见论文第 1 节)。
近年来已有工作把 SVM、判别分析和深度神经网络引入手印性别判断。本文是在一项早期深度学习方法(Mollineda 等)的基础上做的扩展。作者认为,前人的深度学习方法虽然避免了手工特征工程,但仍未系统处理两组不确定性:一是图像和注释层面的不确定性,如颜料侵蚀、边界模糊、手工描边的主观差异;二是跨域迁移的不确定性,即模型在现代手部数据上训练后应用于史前样本。
核心方法和技术细节
整体流水线分为三个阶段。第一阶段是剪影提取与增强。对每张手印同时处理原始图和色调增强图,得到两个手工轮廓 和 。为了不把某一轮廓当作 “唯一真相”,论文用四种二元算子生成中间表示:AND(,高置信交集)、OR(,形状包络并集)、AVG(,概率化软剪影)和 morphological mid-set(,几何中集)。此外,为匹配三通道 CNN 输入,又构造 6 种三通道组合,因此每个手印最终产生 12 种剪影表示(见第 3.3.2 节)。
当代训练数据来自 RSNA Bone Age Challenge,共 14,036 张左手 X 光片。论文先用 Segment Anything Model 的零提示策略提取剪影,最终用于训练、验证、测试的轮廓数分别为 12,509、1,416 和 196(第 4.1.1 节)。模型级不确定性通过训练样本随机顺序带来的不同局部极小值实现;论文没有进行显式超参数调优,作者表示这是为了让框架对非专业人员更友好(第 3.3.3 节)。
第二阶段是集成分类。两个架构 EfficientNet-B3 和 MobileViT-S 各自训练 10 个实例,每个实例处理 12 种剪影,因此每个手印得到 240 个概率预测(每架构 120 个)。聚合分两层:先在模型实例之间用 sum 或 max 融合每个剪影变体,再在 12 个剪影变体之间投票。论文用两个指标衡量内部一致性:剪影支持率 SSR 和平均分类边界 ACM。SSR 范围为 0.5–1,表示多少剪影变体支持最终类别;ACM 反映平均分类边界的强弱。
第三阶段是后验分析。作者将 EfficientNet-B3 每一实例学到的 1536 维特征经 UMAP 投影到二维,再用 k-NN 对史前手印做二次分类。同时,LayerCAM 为每个手印生成 120 张归因图(12 个剪影 × 10 个模型实例),用几何中位数聚合出稳定的原型热图。三路证据共同构成论文所说的 “三角化验证”。
创新点和贡献
论文把不确定性从 “待消除噪声” 转变为 “可分析信号”。其核心贡献可归纳为三点:第一,提出覆盖源图、注释、形态、表示、模型和决策多个层次的显式不确定性建模流水线;第二,用结构化剪影增强生成多种可信轮廓,而不是单一路径;第三,把集成预测、二维潜在空间结构和归因图聚合为三角验证,用一致/分歧程度区分稳定判断与模糊案例(见第 1 节列出的贡献)。
与传统方法相比,该框架不给出单一的 “男/女” 标签,而是同时报告 SSR、ACM、k-NN 支持率以及归因模式。论文认为,这种设计更适合没有生物学真值的考古场景:高共识案例可以作为更可信的辅助证据,低共识案例则应报告为不确定而非强行归类。
实验结果分析
在当代数据上,两种架构的单个模型平均测试准确率均随年龄组上升:例如 EfficientNet-B3 在 [12–19] 岁组平均为 85.3%±0.6%,其 sum 聚合集成达到 88.4%;MobileViT-S 的 max 聚合也达到 88.4%(表 3)。集成在大多数配置下优于单个模型平均准确率,尤其在 [0–6) 岁组,EfficientNet-B3 从单个模型平均 68.1%±1.9% 提升至集成 76.2%(表 3)。这说明在该数据集上,模型多样性聚合能提高小年龄组的稳定性。
史前样本部分,论文只选了 9 个手印作为案例,并非代表性抽样。高共识案例包括 El Castillo img_26、img_28、Cosquer 和 El Castillo 25:它们的 SSR 通常为 1,ACM 较高,且 k-NN 支持率也高(表 4、表 5)。例如 img_26 被两种架构一致判为女性,SSR=1;El Castillo 25 一致判为男性,SSR=1。分歧案例则包括 img_31、Pech Merle 和 Chauvet:这些手印在 EfficientNet-B3 与 MobileViT-S 之间或不同聚合规则之间出现标签翻转,SSR/ACM 也较低。
潜在空间分析中,k-NN 预测与 EfficientNet-B3 集成预测在全部 9 个案例上标签一致(表 5)。LayerCAM 聚合热图显示,模型注意力主要集中在手指、指间区域和掌骨头部,而不是整个手掌或背景。作者认为这与人手两性异形的已知骨骼特征较吻合,但同时指出归因图不能证明因果关系(第 5 节)。具有高共识的案例通常表现出更集中、解剖学上可解释的激活模式;低共识案例的热图则更分散(表 6)。
实践建议
对于考古数字人文项目,这套流水线最值得借鉴的不是 “用深度学习做性别判断”,而是把不确定性纳入决策流程。实际部署时,应至少保留多个图像版本和多个手工轮廓,不把某一次分割当作真值;报告 SSR、ACM 和跨架构一致性,而不是只输出单一类别。若某手印的 SSR 接近 0.5,或两个架构方向相反,论文的做法是将其视为证据不足的模糊案例。
对于更一般的 AI/ML 工程场景,尤其是缺少目标域真值、需要跨域迁移的任务,可以采用类似的多表示 + 多模型 + 分数聚合 + 可解释性验证结构。该框架中每个模块都不复杂,但组合起来能暴露输入和模型带来的不稳定性。论文提供 公开数据集 与 代码仓库,便于复现或改造。
需要避免的误区是,把高共识预测理解为 “证明” 了某位史前作者是男性或女性。论文的作者也强调,所有监督学习方法都依赖现代参考人群,无法直接验证史前人群形态分布;因此这些输出应被视作证据链中的一类,而不是终审判决。