面向生成式推荐的分布式用户兴趣上下文的结构化与分词

Structuring and Tokenizing Distributed User Interest Context for Generative Recommendation

arXiv: 2606.20554v1

论文信息

标题: Structuring and Tokenizing Distributed User Interest Context for Generative Recommendation

作者: Ruizhong Qiu, Yinglong Xia, Dongqi Fu, et al.

发布日期: 2026-06-18

arXiv ID: 2606.20554v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:生成式推荐系统如何同时有效整合全局用户行为图信息和语义 tokenization,而现有方法要么面临可扩展性问题、要么缺乏监督信号。
  • 核心方法:提出 G2Rec 框架,通过稀疏化物品共现图 + 可微分的 “软” 图聚类提取物品兴趣原型,再将这些兴趣原型 token 化后注入生成式序列推荐模型。
  • 关键结果:在 Meta 多产品面的在线 A/B 测试中,G2Rec 在用户总使用时长、点赞、分享等多项互动指标上带来 0.06%–0.19% 的提升(见论文第 5.3 节)。
  • 主要局限:论文未讨论超参数 C(兴趣原型数量)的自动选择方法;稀疏化理论上限基于用户互动数相同(每用户 N 次)的假设。
  • 适合读者:对工业级推荐系统、图学习与 LLM 结合感兴趣的研究者和工程师,尤其是关注可扩展性和线上部署可行性的从业者。

论文背景和研究动机

生成式推荐(Generative Recommendation, GR)正在成为工业推荐系统的新范式。其核心思路是利用大语言模型(LLM)的自回归特性,从用户的历史行为序列预测下一次交互。然而,这一范式面临一个根本挑战:如何在推荐模型中高效整合复杂的用户行为上下文与物品语义上下文。

现有方案主要分为两条技术路线。一是基于图的方法,通过构建用户-物品关系图来建模行为模式。但图序列化方法在处理长序列时计算开销巨大,图神经网络(GNN)通常只能感知每个用户周围的局部子图,无法捕获全局结构信息。二是语义 tokenization 方法,其目标是将每个物品表示为少量语义 token,但这些方法通常依赖于启发式学习目标,缺乏对语义 token 的显式监督信号,可能导致次优表示。

G2Rec(Sparse Co-Engagement Graph Schema for Generative Recommendation)正是为了弥合这两条路线之间的鸿沟:它既要利用全局图结构来建模用户共同互动行为,又要将这种图结构信息以语义 token 的形式注入生成式推荐模型,同时保证整个流程在工业规模数据上可扩展。

核心方法和技术细节

G2Rec 的整体架构分为三个紧密衔接的模块。

模块一:稀疏物品共现图构建

传统做法是构建用户-物品二分图,但在亿级用户规模下这极其昂贵。G2Rec 的关键洞见是:消除用户节点,改用物品-物品共现图(co-engagement graph)来建模用户行为模式。两个物品若被同一用户互动过,则在图中形成一条边。论文证明,每个用户的交互序列恰是该图上的一条路径(见 Observation 1),因此图的边天然编码了用户兴趣转移行为。

然而,原始共现图的边数可达 O(M2)O(M^2)(MM 为总交互次数),这在实际中不可行。G2Rec 采用基于图拉普拉斯谱理论的有放回采样策略,仅对每个用户采样 mm 条共现边,使总边数降至 O(Mlog⁡M)O(M\log M)。理论分析(见 Theorem 2)证明:在采样 m=⌈2N(13ϵ+1ϵ2)log⁡2∣I∣δ⌉m = \lceil 2N(\frac{1}{3\epsilon} + \frac{1}{\epsilon^2})\log\frac{2|\mathcal{I}|}{\delta}\rceil 条边时,稀疏图的拉普拉斯矩阵以高概率 (1−δ)(1-\delta) 近似保持原始图的结构信息,即 (1−ϵ)LE∗⪯LE⪯(1+ϵ)LE∗(1-\epsilon)L_{\mathcal{E}^*} \preceq L_{\mathcal{E}} \preceq (1+\epsilon)L_{\mathcal{E}^*}。

模块二:可扩展的软图聚类

传统图聚类算法(如 Louvain、Leiden)将每个节点硬分配到单一集群,但现实中一个物品可能属于多类兴趣(如一条牛油果吐司视频既属于 “健康饮食” 也属于 “晨间日常”)。G2Rec 提出软图聚类,允许每个物品 ii 在 CC 个兴趣原型上具有分布 pi∈RCp_i \in \mathbb{R}^C。

为实现可扩展优化,作者将经典图模块度(modularity)推广为软模块度(soft modularity)这一可微分目标函数:

Qsoft(P)=Eh∼P[Qhard(h)]=(1∣E∣∑(i,j)∈Epi⊤pj)−γ∥P⊤k∥22∣E∣2Q_{\text{soft}}(P) = \mathbb{E}_{h\sim P}[Q_{\text{hard}}(h)] = \bigg(\frac{1}{|\mathcal{E}|}\sum_{(i,j)\in\mathcal{E}} p_i^{\top}p_j\bigg) - \gamma\frac{\|P^{\top}k\|_2^2}{|\mathcal{E}|^2}

其中 pi⊤pjp_i^{\top}p_j 表示物品 ii 和 jj 属于同一兴趣原型的概率,作为硬模块度中指示函数 1[hi=hj]1_{[h_i=h_j]} 的连续可微替身。当软隶属度矩阵 PP 每行至多 ρ\rho 个非零元素时,该目标可在 O(ρMlog⁡M)O(\rho M\log M) 时间内计算,并且支持 GPU 加速优化(见 Proposition 4)。

模块三:兴趣原型 token 化与序列建模

聚类完成后,每个兴趣原型 aa 的嵌入 vav_a 定义为属于该原型的物品嵌入按隶属度加权平均。物品 ii 的兴趣档案 token yiy_i 则为其各原型嵌入的加权平均:yi=∑a=1Cpi,avay_i = \sum_{a=1}^{C} p_{i,a}v_a。

给定用户交互序列 [i1,…,iN][i_1,\dots,i_N],G2Rec 构造新的序列格式:

Ru:=[⟨BOS⟩,xi1,yi1,…,xiN,yiN]\mathcal{R}_u := [\langle\text{BOS}\rangle, x_{i_1}, y_{i_1}, \dots, x_{i_N}, y_{i_N}]

即物品嵌入与其兴趣档案交替排列。模型同时优化两个损失:(1)标准的下一个物品预测交叉熵损失 Litemt\mathcal{L}_{\text{item}}^t;(2)以物品兴趣档案 pitp_{i_t} 作为软标签的兴趣预测损失 Lprofilet\mathcal{L}_{\text{profile}}^t。这使模型既能学习物品序列规律,又能理解用户兴趣转移的底层模式,而无需人工标注的真实兴趣标签。

创新点和贡献

G2Rec 的创新性体现在三个层面。

理论层面:首次证明 O(Mlog⁡M)O(M\log M) 条边即可近似保持物品共现图的拉普拉斯谱特性(见 Theorem 2 及其附录证明),为工业场景下的图稀疏化提供了理论保障。软模块度目标函数将非可微的组合优化问题转化为可微分的连续优化问题,同时保持了模块度的统计解释。这些证明通过矩阵 Bernstein 不等式完成了严谨的推导。

算法层面:软图聚类以 ρ\rho 为稀疏度参数,使计算复杂度控制在近乎线性,使得在 GPU 上对亿级物品图进行端到端聚类优化成为可能。兴趣档案 token 的设计将图结构信息以连续嵌入的形式自然地融入 LLM 的自回归框架,无需改变模型架构。

工程层面:论文报告了在 Meta 多产品面的成功部署(见论文第 4 节)。由于图聚类和兴趣档案计算均在离线阶段完成,在线推理时仅需简单的嵌入查表和拼接操作,训练批次时间仅增加 0.043 秒,推理时间仅增加 0.0027 秒(见表 3),几乎不影响实际服务延迟。

实验结果分析

离线公开数据集实验:在 Beauty、Sports、Toys、Yelp 四个数据集上,G2Rec 在所有评价指标(Recall@K、NDCG@K、MRR)上均取得最优结果(见表 2)。以 Sports 数据集为例,G2Rec 的 NDCG@5 达到 0.2869,相较最佳基线方法(GRU4Rec 的 0.2497)提升 14.9%。四个数据集的平均排名均为 1.04,远优于其他方法。

在线 A/B 测试:在 Meta 产品面上的短长期测试中,G2Rec 在用户参与度、内容多样性、服务效率等多类指标上均有持续性提升。特别是总使用时长、点赞、分享等关键互动指标上提升 0.06%–0.19%,且带来>0.03% 的会话内提升(见论文第 5.3 节)。考虑到 Meta 产品的亿级月活用户规模,这些相对提升的绝对值影响是巨大的。

消融实验:第一,软聚类 vs 硬聚类的对比显示,G2Rec 的软模块度在四个数据集上均显著高于 Leiden 硬聚类的模块度(如 Sports 上 0.452 vs 0.365,提升 23.8%)(见表 4)。第二,兴趣档案损失权重 λ\lambda 的消融表明,当 λ=0\lambda=0(即不使用兴趣档案损失)时 MRR 显著下降,随着 λ\lambda 增大 MRR 持续改善,验证了兴趣档案监督信号的有效性(见图 2)。

实践建议

对于希望落地类似方法的工业团队,基于 G2Rec 的论文和 Meta 部署经验,可提炼以下建议。

图构建的工程权衡:共现图的稀疏化采样参数 mm 直接影响图结构保真度与计算成本。论文给出了理论界(Theorem 2),但实际部署中可根据业务延迟预算和 GPU 内存约束,先以较小的 mm 做快速实验验证,再逐步增大以逼近理论上界。需注意,定理假设每用户交互数相等,实际分布高度倾斜时可能需按用户分桶调整采样策略。

软聚类的一致性维护:论文提到图聚类算法以离线方式周期性运行(见论文第 4 节)。在实践中,应建立聚类质量监控机制——跟踪软模块度 QsoftQ_{\text{soft}} 的时序变化,当出现显著下降时触发重新聚类。此外,兴趣原型数量 CC 和分辨率参数 γ\gamma 的选择尤为关键:γ\gamma 越大,产生的聚类越细粒度。论文在 Beauty 和 Toys 上使用 γ=0.8\gamma=0.8,Sports 和 Yelp 上使用 γ=1.0\gamma=1.0,说明不同领域的兴趣粒度不同,建议通过验证集上的下游推荐指标来调参。

在线系统的冷启动问题:对于新物品,由于缺乏共现数据,无法直接计算其兴趣档案。一个可行的方案是利用新物品的内容特征找到最近邻的已有物品,暂时共享其兴趣档案;随着互动数据积累,再逐步重建该物品的专属兴趣档案。

生成式模型训练细节:G2Rec 使用 Llama 2 13B 作为骨干,并通过 LoRA 进行参数高效微调。采用 16 秩、0.05 秩丢弃率的 LoRA 配置,Adam 优化器配合余弦学习率调度与 100 步热身(见论文第 5.1 节)。若团队使用不同的 LLM 骨干,建议优先验证这两个损失的权重平衡 λ\lambda 和 LoRA 秩对效果的影响,这两者对计算开销与性能的 trade-off 最为关键。