生成式推荐语言模型中新词汇的根植化词元初始化
Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation
论文信息
标题: Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation
作者: Daiwei Chen, Zhoutong Fu, Chengming Jiang, et al.
发布日期: 2026-04-02
arXiv ID: 2604.02324v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决什么 在语言模型中为新任务添加全新词汇(如生成式推荐中的语义 ID)时,广泛使用的均值初始化会导致所有新词嵌入坍缩为同一点,微调后也难以恢复语义区分度。
-
核心方法:用什么办法解决 提出 “有根基的 Token 初始化”(GTI),在标准微调前插入一个轻量级扎根阶段:冻结整个语言模型骨干,仅用配对的语言监督信号训练新 Token 的嵌入向量,使其在预训练嵌入空间中拥有语义丰富且互不相同的初始化。
-
关键结果:最重要的一个结论或数字 在工业级候选人检索数据集上,GTI 相比均值初始化+监督微调的基准,在严格匹配的 Precision@5 上相对提升 +21.63%(表 1),且持续优于多任务辅助损失方法 LC-Rec。
-
主要局限:作者自己承认的、或方法本身固有的限制 扎根阶段依赖于每个新实体都有对应的自然语言描述(如物品标题/描述),对于无文本描述的新 Token 场景尚未验证;论文仅测试了生成式推荐领域,推广到其他词汇扩展任务的通用性有待确认。
-
适合读者:什么背景的人值得读 从事生成式推荐、大模型词汇扩展、Token 嵌入初始化研究的工程师和研究人员,以及对语义 ID 对齐、嵌入空间几何分析有兴趣的 NLP 实践者。
论文背景和研究动机
预训练语言模型在适应特定领域时,常常需要向词表中加入大量全新的可学习 Token,比如生成式推荐中的语义 ID(Semantic ID)。标准做法是将这些新 Token 的嵌入初始化为现有词表嵌入的均值(Hewitt 等人),随后依赖下游监督微调 “强行” 学出有意义的表示。这种均值初始化虽然在数学上确保新 Token 位于预训练流形内部,却将所有新 Token 压缩到同一个点,抹除了它们之间的区分性。
论文通过谱分解和几何诊断,系统性地揭示了这种初始化方式带来的Token 嵌入失配问题:所有新 Token 的嵌入形成一个退化的低秩子空间,微调后依然面临秩恢复困难、语义结构缺失的困境(见图 2、图 5 和图 7)。作者由此提出了有根基的 Token 初始化假说:在下游微调之前,先用语言信号将新 Token 扎根到预训练嵌入空间中的语义合理位置,能够更好地让模型利用其预训练知识来处理新 Token 领域。这一假说将词汇扩展重新定义为 “Token 扎根问题”,并为后续的 GTI 方法奠定了动机。
核心方法和技术细节
GTI(Grounded Token Initialization)是一个在标准微调前插入的、极轻量的扎根阶段。其核心操作如下:
-
冻结模型骨干,仅学习新 Token 嵌入:给定预训练的自回归语言模型,将嵌入矩阵分为原有部分 和新 Token 部分 。扎根阶段冻结 以及所有 Transformer 层参数,只让 可训练。由于语言模型通常采用输入嵌入与输出头权重绑定的参数化方式,训练新嵌入同时也是在塑造模型生成新 Token 的分布。
-
双向语言配对监督:为每个新实体准备自然语言描述 (如物品标题、描述)和对应的新 Token 序列 (例如语义 ID 的多个层级 Token)。训练语料包含 和 两个方向,通过指令模板构造标准语言建模损失,仅优化新嵌入。损失函数为:
其中 中的其余参数全部冻结。
-
扎根后标准微调:GTI 阶段结束后,保留学到的 作为初始化,再解冻所有参数进行常规的下游监督微调(SFT)。整个过程不需要修改微调损失函数,也不引入额外的辅助任务目标。
论文在生成式推荐场景下实现该方法,数据集包括一个工业级候选人检索系统和一个公共服装租赁数据集。语义 ID 通过 RQ-VAE 对物品内容表示进行残差量化获得,每个语义 ID 的码本条目成为一个独立的新 Token。扎根阶段使用配对(标题/描述 语义 ID)进行双向训练(附录 7.2 提供了多种模板示例),8000 步、batch size 128。随后进行等步长的全参数解冻 SFT。所有实验采用 Qwen3-0.6B 作为骨干模型。
创新点和贡献
论文有三方面明确贡献,各有诊断和实验支撑。
诊断创新:首次用谱分析和几何分析量化了均值初始化引发的 Token 嵌入坍缩现象。在初始化时,SID 嵌入之间的余弦相似度近似均匀且无语义(图 5 中间);微调后,均值初始化路径下的 SID 嵌入矩阵的奇异值谱衰减极快、有效秩低(图 7(a) 工业数据集,图 8 见附录),同时 SID 之间的余弦相似度失去层级码本应有的分块结构(图 6 左中)。这些证据明确表明,仅靠微调难以复原初始坍缩所丢失的 Token 间区分度。
方法论贡献:提出 GTI 扎根阶段,将 “冻结骨干+仅训嵌入” 的范式重新定位为一种初始化策略,而非特定任务的最终适配手段。GTI 既保留了新 Token 在预训练流形上的起点优势,又引入了清晰的语义区分和结构,且无需改动下游训练流程。与 LC-Rec 等多任务辅助损失方法相比,GTI 在初始化时就解决问题,避免了目标不匹配带来的效果受限。
实验贡献:在工业规模数据集和公共数据集上,GTI 一致性地取得了优于均值初始化和 LC-Rec 的结果。工业数据集上,严格匹配(Good Match)条件下 GTI 相比基线 SFT 在 Precision@5 的相对提升达+21.63%,NDCG@5 提升+17.88%(表 1、表 2),且这种优势在不同候选池大小和评估截断下保持稳健(图 3)。公共数据集上,即使不添加任何辅助损失,仅 GTI+普通 SFT 就在 Recall@20 上取得+26.02% 的相对提升(表 3),而 LC-Rec(多任务 SFT)仅为+13.41%,证实了扎根初始化本身贡献巨大。进一步的分析表明,GTI 产生的嵌入在微调后仍保留更高的有效秩和与 RQ-VAE 真实码本结构更强的相似性(RSA 分析,图 7(b)),说明扎根结构可以 “存活” 到微调结束。
实验结果分析
论文通过精细的对照消解了不同成分的作用。对比 LC-Rec(均值初始化+多任务 SFT)和 GTI(扎根初始化+普通 SFT 或额外多任务 SFT),实验明确显示出初始化时机的决定性作用。即使 LC-Rec 在微调期间引入相同的语言对齐信号,其增益也远低于 GTI 直接提供扎根起点(表 1、表 2 的 行),且 GTI 加多任务 SFT 的组合提升最大,表明两者可以互补但起点质量是瓶颈。
公共数据集上的消融中,GTI+vanilla SFT 不用任何多任务损失就在多数 Recall 指标上超越 LC-Rec,说明多任务损失并非必要的性能来源,高质量的初始化才是关键。同时,微调后的嵌入余弦相似度图(图 6)显示,只有 GTI 初始化能够保持语义 ID 的层次分块结构,与 RSA 结果共同印证了扎根结构对微调过程的持久影响。
模型诊断还揭示了有趣的现象:随机初始化虽然避免坍缩,但毫无语义信息,导致微调后相似度图呈现噪声(图 6 右),其最终表现也欠佳。这再次强化了 “既不能坍缩又不能无结构” 的论点,GTI 完美平衡了这两点。
实践建议
GTI 为工业界快速将新领域实体接入预训练语言模型提供了一条清晰的路径。实践落地时可参考以下要点:
-
扎根数据构造:每个新 Token(如物品 ID、产品码、实体符号)都需要配对至少一段自然语言描述。双向生成(描述 符号序列,符号序列 描述)能够丰富嵌入的语义信号。如果新 Token 本身无法关联文本说明,可能需要先通过知识图谱或属性拼接出伪文本描述,否则 GTI 不适用。
-
训练配置与规模:扎根阶段通常只需数千步,冻结模型主干,学习率可以设得较高(论文使用 1e-3)。仅在嵌入矩阵上训练,参数量仅为 ,非常轻量,几块 GPU 即可完成。扎根后进行常规 SFT,无需修改原有的生产训练流程,迁移成本低。
-
适用边界与扩展:目前证据最强的是生成式推荐中的语义 ID 初始化,但论文方法不依赖任何推荐专有模块。当要为新引入的知识图谱节点、搜索行为符号、工具 API 等 Token 初始化时,只要存在文本描述,GTI 即可直接套用。但需警惕,若新 Token 的语义与预训练嵌入空间差异过大(如纯粹的数字编号且无对应语言),生根阶段可能无法获得有效起点,此时需探究其他初始化手段。
-
监控与诊断:在部署前,应通过余弦相似度矩阵检查新 Token 嵌入是否出现坍缩。如果 GTI 后相似度矩阵仍然均匀,则说明描述语言质量不足或数量不够,需补充语料。微调后也可通过有效秩或与真实码本的 RSA 相关度来评估嵌入质量退化的程度。
GTI 的本质是将昂贵的任务特定知识以初始化形式一次注入,这为大规模语言模型系统在词汇扩展场景下提供了可控且高效的质量保障。随着更多领域依赖 LM 吸纳专有符号,这种扎根策略有望成为标准预处理步骤。