知识嵌入潜在投影的鲁棒表示学习

Knowledge-Embedded Latent Projection for Robust Representation Learning

arXiv: 2602.16709v1

论文信息

标题: Knowledge-Embedded Latent Projection for Robust Representation Learning

作者: Weijing Tang, Ming Yuan, Zongqi Xia, et al.

发布日期: 2026-02-18

arXiv ID: 2602.16709v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决在高维离散矩阵(如电子健康记录)中,当样本量远小于特征数(n≪pn \ll p)时,如何借助外部语义嵌入来改善低维表示学习,以解决标准模型估计不准的问题。
  • 核心方法:提出知识嵌入潜投影(KELP)模型,将列嵌入建模为外部语义嵌入在再生核希尔伯特空间(RKHS)中的平滑映射,并通过核主成分分析(KPCA)提取主要子空间,用可扩展的投影梯度下降算法进行优化。
  • 关键结果:理论证明 KELP 的均方误差从标准模型的 O((n+p)/np)\mathcal{O}((n+p)/np) 改善为 O((n+q)/np+λq+1)\mathcal{O}((n+q)/np + \lambda_{q+1}),在高维不平衡场景下效果显著(见论文定理 1、推论 2.1 及仿真结果图 1)。
  • 主要局限:方法依赖外部语义嵌入的质量,若外部知识与内部数据结构不匹配,近似误差会增大;算法收敛要求初始化足够精确,且理论分析基于某些边界条件(见论文定理 2 条件 C4、C5 及注记 6)。
  • 适合读者:对量化交易、量子计算或人工智能领域中高维稀疏矩阵建模、表示学习及数据融合技术感兴趣的统计学家、机器学习工程师和医疗数据分析师。

论文背景和研究动机

在许多科学和工程领域,如基因组学中的变异突变数据、社交网络中的二部关系数据以及电子健康记录(EHR)中的临床事件数据,数据通常以高维离散矩阵的形式呈现。这些矩阵的两个维度对应不同类型实体,例如患者与临床特征,且往往展现出由少数潜在因子解释的结构化依赖模式。潜在空间模型通过为行、列实体分配低维嵌入,利用嵌入之间的交互对观测数据进行建模,不仅灵活捕捉复杂依赖关系,还能将高维数据压缩为低维表示,广泛应用于可视化、聚类、风险预测和缺失值插补等下游任务(Van Den Oord 等, 2017; Kopf 和 Claassen, 2021; Lavrač 等, 2021)。

然而,在现实应用中,这类矩阵常常面临维度不平衡的挑战。以 EHR 为例,疾病特异性队列(如本研究中的多发性硬化症患者群)的样本量(患者数 nn)受限于疾病罕见程度、纳入标准或数据可得性,但特征空间(诊断编码、药物处方、实验室检查等)却因现代医疗编码系统的细粒度特性而极其庞大,特征数 pp 可达数千甚至更多,导致 n≪pn \ll p 的不平衡局面。对于标准广义潜在因子模型(GLFM),每参数的平均估计误差以速率 O((n+p)/np)\mathcal{O}((n+p)/np) 随对数因子缩放(Chen 等, 2019; Wang, 2022; Chen 等, 2023),在 n≪pn \ll p 时误差主要由极其有限的样本量主导,估计极不稳定。

此外,EHR 数据具有高稀疏性,每个患者的记录中只包含全部可能特征的一小部分,大多数矩阵元素为零(Wu 等, 2024)。这就使得原本已经困难的估计问题更加雪上加霜。但值得庆幸的是,EHR 中的列实体(临床特征)并非抽象的索引,它们富含语义。例如,诊断和手术编码可以通过从大型生物医疗语料库中预训练的嵌入(如由百万级患者数据训练得到的 128 维 VA 嵌入)获得有意义的语义表征,这些表征编码了疾病间、药物间及疾病-药物间的拓扑关系。这种外部语义旁信息为克服不平衡与稀疏性问题提供了新契机:语义相似的临床特征,其在潜在空间中的嵌入也应当接近,从而可以通过这种结构化先验来约束、正则化潜在结构的估计。这正是本论文提出知识嵌入潜投影(KELP)模型的出发点。

核心方法和技术细节

KELP 模型的核心思想是用外部语义嵌入来约束列嵌入的学习。具体而言,对于一个 n×pn \times p 的二值患者-特征矩阵 YY(yij=1y_{ij}=1 表示特征 jj 出现在患者 ii 的记录中),模型假设 yijy_{ij} 独立服从伯努利分布,其概率由行嵌入 ui∈Rr\bm{u}_i \in \mathbb{R}^r 和列嵌入 vj∈Rr\bm{v}_j \in \mathbb{R}^r 的内积、行特异性偏倚 αi\alpha_i 以及全局稀疏度 ρ\rho 通过 sigmoid 函数变换后决定:

P(yij=1∣{ej}j∈[p])=σ(ρ+αi+ui⊤vj),vj=φ(ej).\mathcal{P}(y_{ij}=1 \mid \{\bm{e}_j\}_{j \in [p]}) = \sigma(\rho + \alpha_i + \bm{u}_i^\top \bm{v}_j), \quad \bm{v}_j = \bm{\varphi}(\bm{e}_j).

与标准 GLFM 不同,KELP 不把列嵌入 vj\bm{v}_j 当作自由参数,而是认为它们通过未知映射 φ:Rd→Rr\bm{\varphi}: \mathbb{R}^d \to \mathbb{R}^r 作为外部语义嵌入 ej∈Rd\bm{e}_j \in \mathbb{R}^d 的平滑函数而生成。这种平滑性通过假设每个分量函数 φk\varphi_k 属于某个再生核希尔伯特空间(RKHS)来形式化,该空间关联一个正定核 K(⋅,⋅;η)\mathcal{K}(\cdot,\cdot;\eta)(如高斯核或多项式核),不同的核定义不同的平滑性概念。由 Representer 定理,最优的 φk\varphi_k 必在观测到的核函数截面的张成空间中,因此列嵌入矩阵可表示为 V=KcA\bm{V} = \bm{K}_c \bm{A},其中 Kc\bm{K}_c 是中心化 Gram 矩阵,A\bm{A} 是系数矩阵。这就将语义平滑性转化为一种对列空间的结构化低维约束。

为保证模型可识别,本论文加上约束条件:α⊤1n=0\bm{\alpha}^\top \mathbf{1}_n = 0(行偏倚中心化),V⊤1p=0r\bm{V}^\top \mathbf{1}_p = \mathbf{0}_r(列嵌入中心化),以及 U⊤U=V⊤V\bm{U}^\top \bm{U} = \bm{V}^\top \bm{V}(平衡缩放矩阵的奇值分解)。普适性命题 1 证明了在此条件下,除正交旋转外,参数是唯一的。

估计方法采用两步策略。第一步,通过 KPCA 在语义嵌入上识别一个低维子空间:对 Kc\bm{K}_c 进行特征分解,选取前 qq 个特征向量(满足解释方差比 ≥1−δ\ge 1-\delta),构成基底 Ψ[q]∈Rp×q\bm{\Psi}_{[q]} \in \mathbb{R}^{p \times q},将列嵌入约束为 V=Ψ[q]Γ\bm{V} = \bm{\Psi}_{[q]} \bm{\Gamma} (其中 Γ∈Rq×r\bm{\Gamma} \in \mathbb{R}^{q \times r} 为映射系数矩阵),从而将 p×rp \times r 的自由参数压缩为 q×rq \times r。第二步,用投影梯度下降(PGD)最小化负对数似然,迭代更新参数时投影 V\bm{V} 到 col(Ψ[q])\text{col}(\bm{\Psi}_{[q]}),并且加入正则项 14∥U⊤U−V⊤V∥F2\frac{1}{4}\|\bm{U}^\top \bm{U} - \bm{V}^\top \bm{V}\|_F^2 来鼓励因子分布平衡。该算法每次迭代计算 V\bm{V} 的代价从双表示法的 O(p2r)\mathcal{O}(p^2 r) 显著降低到 O(npr+pqr)\mathcal{O}(np r + p q r),适合 n≪pn \ll p 的场景(详见算法 1 及注记 3)。

对于实践中可能出现的核错配,论文设计了一个数据驱动的核选择流程:随机屏蔽掉 10% 的矩阵元素(作为验证集),针对多个候选核(包括线性核、不同半径的高斯核)和不使用外部信息的基线模型,用剩余 90% 数据拟合,挑选在屏蔽元素上损失最小的那个核,以此避免有害的知识融合。

理论结果(定理 1)为估计误差提供了非渐近上界:带约束问题的全局最优解 Θ^\widehat{\bm{\Theta}} 与真实值 Θ∗\bm{\Theta}^* 的均方误差被统计误差 En,q,r\mathcal{E}_{n,q,r} 和逼近误差 An,p,q\mathcal{A}_{n,p,q} 两项之和所控制:

1np∥Θ^−Θ∗∥F2≲e2M1r(n+q)log⁡(n+q)np⋅max⁡{e−M2,log⁡(n+q)n+q}+e2M1λq+1.\frac{1}{np}\|\widehat{\bm{\Theta}} - \bm{\Theta}^*\|_F^2 \lesssim e^{2M_1}\frac{r(n+q)\log(n+q)}{np} \cdot \max\{e^{-M_2}, \frac{\log(n+q)}{n+q}\} + e^{2M_1}\lambda_{q+1}.

与标准 GLFM 的 O((n+p)/np)\mathcal{O}((n+p)/np) 相比,KELP 成功将分母中 pp 的影响换为 qq——当 qq 固定或远小于 pp 时,即使在 n≪pn \ll p 下也能获得关于 pp 递减的速率(例如对于线性核,q=dq = d 常数,速率达到 O(p−1/2)\mathcal{O}(p^{-1/2}))。当然,逼近误差 An,p,q\mathcal{A}_{n,p,q} 取决于核谱的衰减:若真实映射处于主成分张成的空间中,逼近误差为零;否则,核谱衰减越快(如 RBF 核呈指数衰减),这部分的误差越小。定理 2 进一步证明了 PGD 算法有局部线性收敛性:给定合适的初始化,tt 次迭代后的误差以几何速率变小,最终到达由统计误差和逼近误差决定的统计容限(见推论 2.1)。

创新点和贡献

本论文有以下几个重要创新:

  1. 领域知识融合的新框架:首次在潜空间模型中通过 RKHS 框架将外部语义嵌入系统性地整合为对列表示的平滑约束,有效地解决了不平衡数据分析这一普遍的实际问题。该方法既容纳了复杂的非线性映射,又保持了维度缩减的可解释性。
  2. 理论特征化与权衡分析:清晰地将估计误差分解为统计误差和语义逼近误差,给出了非渐近的均方误差界,并量化了采用 KPCA 降维后精度与效率的权衡关系。这为实践中合理选择子空间维度 qq 提供了指导(见论文第 4.1 节及注记 5、6 中的讨论)。
  3. 算法贡献:提出的 KPCA-PGD 两步算法通过预计算核主成分来约束优化空间,相比朴素的 RKHS 双表示法大幅降低了每次迭代的计算开销,使得方法能够实际部署在 pp 超大(如几千到上万维)的 EHR 场景。
  4. 实践验证:在仿真中系统考察了样本量、特征数和稀疏性三个维度的影响(图 1),结果与理论预测高度一致。在多发性硬化症真实 EHR 数据的应用中,KELP 在知识图谱重建和患者残疾表型预测两个具有临床意义的下游任务中表现出优于基线模型(甚至优于原始的 128 维通用 VA 嵌入)的性能(图 2),证实了模型在当地小样本队列表中能有效精炼领域通用知识。

实验结果分析

仿真研究(第 5 节)中,作者在 “样本量变化”(nn 从 200 到 1600,固定 p=4000p=4000)、“特征数变化”(pp 从 500 到 4000,固定 n=200n=200)和 “稀疏度变化” 三种场景下对比 KELP 和标准 GLFM。结果如图 1 所示:

  • 随 nn 增加,KELP 在 nn 较小时优势突出;当 nn 较大时,数据驱动核选择可自适应地退化到基线以避免核错配带来的误差,最终两者收敛。
  • 随 pp 增加,KELP 的相对误差以明显快于基线的速率下降(特别是在线性映射场景,误差与 p−1/2p^{-1/2} 成比例),反映理论中 pp 被 qq 取代的收益。
  • 随着稀疏度提高(非零条目比例从 40% 降至 10%),两种方法误差均增加,但 KELP 增幅较小,且对 V\bm{V} 恢复的稳健性显著强于对 U\bm{U} 的恢复,这是因为 V\bm{V} 直接受到外部的语义约束。

实际 EHR 应用(第 6 节)在一个包含 212 名确诊 MS 患者、3296 个临床特征(88.3% 零值)的数据集上进行。KELP 使用从 VA 大型队列预训练的 128 维语义嵌入作为外部知识。在知识图谱重建任务中,KELP 的 AuROC 值在所有考虑的潜维度 rr 下均优于仅用 MS 数据训练的 GLFM 以及原始的 VA 嵌入,且在 r=8r=8(通过矩阵填充验证选出的最优秩)时达峰值。在残疾表型预测中,以患者嵌入作为特征的逻辑回归模型胜过直接使用高维稀疏特征的模型,表明 KELP 成功将稀疏 EHR 数据压缩为信息密集的低维表示。

实践建议

对于有明确工程落地场景的量化交易、人工智能或医疗数据分析从业者,结合本论文的研究成果,可以考虑以下实现和实践策略:

  1. 利用外部嵌入知识库:在构建推荐系统、风险评估模型或医疗决策支持系统时,如果面临样本量远小于物品/特征数量的挑战,可积极寻找或预训练物品的语义嵌入(例如,通过 NLP 模型从物品描述中提取的向量,或开源的知识图谱嵌入)。将这些嵌入作为 KELP 的输入,可显著提升潜在因子模型的稳健性。
  2. 核函数的选择与定制:根据领域先验选择核函数类型。如果认为语义嵌入与目标嵌入之间是线性关系,可选用线性核(实现简单,解释性强);若预感存在复杂非线性交互,可尝试高斯核,并通过数据驱动的验证(如文中介绍的随机屏蔽一部分矩阵条目)来优化核宽 η\eta 和子空间维度 qq。此举能有效防止不恰当的外部知识被强行注入模型。
  3. 算法实现与调参:采用两步法实现。第一步用 KPCA 对语义嵌入矩阵进行特征分解,保留解释方差比达到 95%--99% 的主成分,降低 qq(实验表明 qq 往往只需几十维即可捕获大部分平滑变化)。第二步使用投影梯度下降,需注意:设置步长参数时,对 ρ\rho、α\bm{\alpha} 和 U\bm{U}/V\bm{V} 使用不同的标准化(参考论文 3.2 节的建议);精细调整正则系数 14\frac{1}{4} 以保持 U⊤U≈V⊤V\bm{U}^\top\bm{U} \approx \bm{V}^\top\bm{V} 的平衡约束;初始化可用通用奇异值截断方法。
  4. 业务场景适配:在应用中可以利用 KELP 的 Nyström 扩展能力(见注记 4),对新出现的物品(如新上线股票、新注册药物)无需重新训练模型即可计算其潜在嵌入,这对于要求实时推理或线上更新的系统非常有价值。
  5. 计算资源评估:由于 KELP 的每轮复杂度为 O(npr+pqr)\mathcal{O}(np r + p q r),当 pp 巨大时,可考虑截取主导特征值数量更少的 qq,或采用随机化核 PCA 近似进一步降低预计算开销。对于 nn 极小的情况(如罕见病队列,nn 仅几十例),应优先保证外部嵌入的高度相关性与精确性,否则模型可能受逼近误差影响较大,此时可选择使用基线模型作为最终方案。