面向任务无关持续学习的稀疏子空间至专家共享
Sparse Subspace-to-Expert Sharing for Task-Agnostic Continual Learning
论文信息
标题: Sparse Subspace-to-Expert Sharing for Task-Agnostic Continual Learning
作者: Fatema Siddika, Md Anwar Hossen, Tanwi Mallick, et al.
发布日期: 2026-06-05
arXiv ID: 2606.07500v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决大语言模型在持续学习中的灾难性遗忘问题,核心是在不牺牲新任务学习能力的前提下,保住旧任务的知识。
-
核心方法:提出 SETA 框架,通过稀疏梯度驱动的子空间发现,在 MoE 架构里把参数自动拆分为专属专家(只存某一任务的知识)和共享专家(存跨任务的共同特征),再用自适应弹性锚定和路由正则化保护共享专家不被改写。
-
关键结果:Qwen3-4B 的六任务持续学习总体准确率 43.30%,反向迁移 BWT 为 -12.67,均优于 I-LoRA 等基线(见论文表 1)。
-
主要局限:只在 14B 参数以下的注意力 Transformer 上验证过;共享专家池会随任务数持续膨胀,缺少剪枝或合并机制(见论文 Limitations 节)。
-
适合读者:做持续学习、LLM 微调、参数高效训练或 MoE 架构的研究者和工程师,尤其是需要在无任务 ID 的场景下部署多任务模型的人。
论文背景和研究动机
大语言模型虽然在各类 NLP 任务上表现都很强,但一到持续学习场景就遇到老问题——灾难性遗忘。每次为了学新任务去更新参数,之前学到的知识就可能被冲掉。这个可塑性与稳定性的冲突,在参数高效微调(PEFT)方法里更明显:这类方法本来只动很少的参数,却因为更新空间极为狭窄,每次新任务梯度很容易直接压过历史参数的信息(见论文第 2.1 节)。
现有方案主要分三类:回放历史数据、对关键参数的更新施加统一惩罚、给每个任务分配独立参数模块。但论文作者指出了一个共同盲点:这些方法在各自的子空间里仍然把所有参数一视同仁,不会区分哪些参数存的是通用特征,哪些是任务专属特征。这就导致共享子空间困境——一旦某个参数块同时被多个任务需要,统一惩罚太死,会限制新任务的学习;不惩罚又可能让旧知识被改写(见论文第 2.2 节)。
SETA 的出发点正是打破这种 “统一对待”。论文的核心观察是:在稀疏微调里,梯度信号高度集中在 Value 投影矩阵的某些分块上,而不是均匀分布在全参数空间。这就给了模型一种天然的结构信息:哪些参数块在反复被不同任务需要,哪些是一锤子买卖。基于此,论文提出了自适应稀疏子空间到专家的拆分框架,目标是用一种结构上的解耦来从根本上避免参数争抢。
核心方法和技术细节
SETA 的设计围绕三个核心机制:稀疏子空间选择、Split-on-Share 专家拆分、以及双层防护的遗忘抑制。
稀疏子空间选择
训练每个新任务之前,SETA 会在一个自适应的预热阶段跑少量步骤,用梯度幅度来快速定位哪些参数分块是当前任务的高价值区域。具体做法是把每个线性层的权重矩阵切成固定大小的 分块,然后算各个分块的平均绝对梯度,再在层内做标准化。从第二个任务开始,还会引入一个发散分来奖励那些历史任务没怎么触动过的分块,这个发散分的权重随任务数增加而自动衰减,不需要人手动调。最终选出来的分块构成当前任务的活跃子空间。论文观察到大约 95% 的高梯度集中在 Value 投影上(见论文第 3.1 节及附录 图 7),因此分块选择只作用于 V 矩阵。
Split-on-Share 专家进化
这个机制是整个框架的神经中枢。当新任务选出的分块跟历史累积子空间发生重叠时,SETA 不是简单地把重叠部分划给某个任务,而是通过一个拓扑过滤器来决定哪些重叠是真实的语义共性,哪些只是随机梯度噪声。
具体操作是在每一层分别计算交集和差集,然后过两道阈值关卡:重叠太少的分块被认为没有结构性意义,直接打回专属区;差集太小的残留碎片为了避免碎片化,直接吞进共享区。只有那些重叠量足够多、跨越多个任务的参数分块,才会被正式提升为 “可训练的共享专家”。所有历史专属专家则被严格冻结,零梯度(见论文第 3.3 节)。
双层遗忘防护
共享专家的存在对正向迁移有好处,但也最容易被新任务改写。SETA 的设计思路是 “结构隔离 + 权重保护”。
结构隔离的边界很清楚:所有过去的专属专家被硬冻结,当前任务只能修改本任务的专属专家和共享专家。而在共享专家上施加的不是统一惩罚,而是一个自适应的弹性锚定,其中每个专家的保护强度由两个因素实时决定:一是这个专家已经积累了之前多少个任务的知识,二是它当前权重相对于 “快照” 的漂移程度。漂移越大,锚定越强,形成一个自我修正的闭环。这还不够,SETA 还同时训练门控路由,让它在做路由决策时就主动避开那些已经漂得比较狠的共享专家,相当于在问题发生之前就堵住入口。
这两个损失共享同一套保护系数,没增加额外超参(见论文第 3.4 节和 3.6 节)。
任务无关推理
最终在推理时,门控网络对所有专家统一打分,输入 token 通过 softmax 加权组合多个专家的输出,完全不需要外部的任务 ID。这种内容驱动路由加上专家功能隔离,是 SETA 能实现任务未知部署的关键(见论文第 3.8 节)。
创新点和贡献
SETA 的核心贡献在于改变了持续学习中参数冲突的处理方式,从 “惩罚冲突” 转向 “分离冲突再保护”。
第一个独特的思路是用稀疏梯度子空间作为自然的知识结构探针。论文不是从语义或任务边界出发做解耦,而是利用模型自身对任务的梯度响应模式,这比人为划分任务更灵活,也更适合大模型的内部表示。
第二个是把参数重用的决策变成一个硬性的拓扑操作。Split-on-Share 通过两个阈值在每一层独立决定哪些参数应该跨任务共享、哪些应该私有,这就产生了一种 “按需专家成长” 的效果。实验数据也支撑了这种设计:随着任务数增加,新任务发现的独自分块数从 Task 1 的 720 块锐减到 Task 6 的 195 块,表明后面的任务大部分都在复用(见论文图 4、图 8 及附录表 6)。
第三个是双层保护策略。仅靠弹性锚定只能修正已经发生的漂移,而路由层面的正则化可以提前降低共享专家被激活的概率,这会让新任务梯度很难大量流入共享专家,从训练信号分配上就减少了遗忘的驱动力。
实验结果分析
总体表现
实验用 TRACE 基准的六个任务序列,涵盖了教育、金融、政治、多语言和数学推理等多个领域。在 Qwen3-4B 上,SETA 的总体准确率 43.30% 是所有对比方法中最高的,比 I-LoRA 高了超过 5 个百分点,反向外迁移 BWT 同样是最好水平(表 1)。LLaMA-2 7B 上也是类似趋势,总体准确率小幅领先,但在早期任务的保留上优势尤其明显(见论文表 2、表 3)。
最说明问题的一个对比:I-LoRA 在 FOMC 任务上最终准确率掉到 8.1%,几乎完全遗忘,而 SETA 仍然能保持 26.41%(见论文表 3)。这是因为 FOMC 的很多关键参数块在前面的 C-STANCE 任务已经被选为共享专家,SETA 的保护机制让这些块在后续训练中免于被覆盖。
可塑性-稳定性平衡
从任务维度的精度矩阵(附录表 5)可以清楚看到训练过程中各项指标的演化。以 Qwen3-4B 为例,Task 1 精度从初始 57.01% 到最终 63.64%,不仅没掉,还出现正向反向迁移。这说明 Split-on-Share 不但没拖后腿,反而让早期任务从后面学到的共享知识中获益。同时,新任务的塑性也没被牺牲,Task 4 的初始精度 75.90% 依然很强。论文也报告了路由正则化的消融实验,去掉之后总体准确率下降到 38.48%,BWT 恶化,尤其早期任务的保留明显变差(附录表 5)。
参数效率
六任务跑完,可训练参数只从 6.34M 增长到 8.10M,占 LLaMA-2 7B 总参数的 1% 左右,跟 I-LoRA 的 8.39M 在同一量级(表 4)。但考虑到 SETA 的专家架构带来的是分治保护和任务无关推理能力,这个参数开销就更划得来。
实践建议
SETA 的工程落地路径已比较清晰,适用于需要在同一个模型底座上持续接入新领域任务、又无法承受全量重训的场景。以下是几个关键经验:
1. 梯度引导的分块预算密度是一个核心调参入口。 论文的消融显示 13% 和 25% 的预算密度直接影响专家创建阈值 ECT 的选择和共享专家规模(见图 3)。实践中应先在验证任务上测试预算带来的分块分布变化,再配合调节 ECT 来确定共享力度。论文推荐从 13% 预算 + ECT=4 的配置开始,这组参数下共享池增长比较平缓。
2. 弹性锚定和路由正则化要联合启用。 消融实验已经证明单靠权重锚定覆盖面不够,脱掉路由正则化会让部分任务的准确率下降超过 10 个百分点(附录表 5)。这两个损失共享 λ 系数,实现成本很低,没理由只开一个。在任务序列较长时,论文建议共享专家的 λ 应随其累积任务数增加而线性放大。
3. 分层专家拆分需要配合模型结构手动检查。 论文只对 V 投影矩阵做分块选择,这依赖一个观察:95% 的高梯度集中在这里(附录图 7)。如果要用 SETA 处理非纯 Transformer 或结构差异很大的模型,应对不同矩阵的梯度分布先做统计再决定选择范围。
局限与待解决问题
第一,共享专家池的膨胀缺乏约束。论文 3.3 节承认了专家增长呈亚线性趋势,但承认这只是一种经验观察而非理论保证。在长任务序列下,如果每两到三个任务就拆分出一个新的共享专家,最终专家总数可能涨到几百个,存储开销虽然仍低于全量模型,但管理复杂度不可忽略。没有剪枝或合并机制是个实际的问题。
第二,缺少任务顺序敏感性的系统性验证。论文采用了固定六任务顺序,但 Split-on-Share 的拆分决策依赖于当前子空间与历史累积的交集。不同的任务顺序可能导致差异较大的专家拓扑结构,论文没有给出鲁棒性分析。
第三,模型的灾难遗忘保护约束可能会在极端任务序列下产生一种 “软饱和”。因为新任务的专属专家规模随时间递减(图 4 所示的发现率下降趋势),当某个任务跟历史任务的语义重叠很少时,可用的新建专属空间可能已经不多,这会限制其塑性。论文 4.5.1 节也提到参数稀疏带来的容量瓶颈可能导致塑性受限,虽然目前六任务长度下还没出现此类状况。