从单一模型到多重心智:面向群体智能的贝叶斯 Transformer
Many Minds from One Model: Bayesian Transformers for Population Intelligence
论文信息
标题: Many Minds from One Model: Bayesian Transformers for Population Intelligence
作者: Diji Yang, Yi Zhang
发布日期: 2025-12-31
arXiv ID: 2512.25063v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:大语言模型经过对齐训练后倾向坍塌到狭窄的推理模式,丧失多样性。如何在不训练多个完整模型的前提下,从单一预训练权重中产生多样化且连贯的 “群体智能”?
- 核心方法:将归一化层的偏置项替换为高斯分布的随机变量,每次生成序列时采样一个固定的 “思维实例”,使得同一个 Transformer 在参数空间内形成不同的功能个体,且在序列内保持时间一致性。
- 关键结果:在多选题推理(MMLU-Pro)上,用 K 次采样取最优答案的 Pass@K 指标,B-Trans 在高 K 时显著超越高温度采样的确定性基线(图 2),验证了参数空间多样性能够产生额外的有效推理路径。
- 主要局限:扰动仅施加于归一化层偏置,注意力与前馈权重保持确定性;高斯先验为各向同性且方差固定,没有学习或自适应调整;实验规模有限,仅在可控条件下验证核心设计。
- 适合读者:从事大模型推理、强化学习、生成多样性或贝叶斯深度学习研究的研究者,以及对低成本模型群体探索感兴趣的工程师。
论文背景和研究动机
当前大语言模型(LLM)的部署几乎都是 “单思想” 系统:训练结束后得到一组确定的参数,代表对数据的单一功能假设。这种点估计虽然能有效利用预训练知识,但限制了模型表达不确定性的能力。近期研究表明,经过 SFT 和 RLHF 等对齐流程后,模型推理模式会发生严重的结构性同质化,即概率质量过度集中在少数推理路径上,导致在复杂推理任务中难以探索替代方案,容易陷入局部最优。
现有的多样性引入策略大多作用于解码阶段,例如增加温度或核采样,它们只在输出 token 分布上施加表面扰动。在数学推理等任务中,这样的随机性常常退化成统计噪声,无法系统性地发现新的解题路径,甚至会破坏逻辑连贯性。问题的根源在于,仅仅操纵输出 token 并不能改变底层确定性的推理引擎。因此,论文提出退后一步:不再只依赖输出空间随机性,而是在参数空间构建一个局部后验代理,通过采样不同的 “心灵” 来实现真正的思维多样性。
本文由此引入 Population Bayesian Transformers (B-Trans),其动机是 “从许多心灵中涌现智能”,希望将单一 Transformer 转化为多样化的模型群体,在几乎不增加计算开销的条件下实现群体层面的探索与决策。
核心方法和技术细节
从 MAP 估计到局部高斯近似
B-Trans 将预训练权重 视为最大后验估计,并利用拉普拉斯近似将后验 建模为高斯分布:
对十亿参数模型计算完整协方差不可行,而且推理时无训练数据或梯度,无法可靠估计后验的各向异性。出于信息论角度,论文选择各向同性协方差 :在约束期望欧氏距离的条件下,该分布具有最大熵,相当于定义了一个球形信任域用于探索。这一近似并非追求严格贝叶斯推断,而是为了在工程可行性与理论动机之间取得平衡。
假设采样与时间一致性
与每次前向传播独立扰动的 Dropout 不同,自回归生成中需要维持一个连贯的假设。论文提出 “假设采样”:序列开始时从近似后验中采样一次 ,并将该噪声冻结,整条序列由同一个模型实例生成。预测分布为:
这种设计确保每个生成结果对应一个逻辑一致的 “人格”,避免 token 级重采样导致思维跳跃。实际实现中,只需缓存一个极小的偏置噪声向量(<1MB),而非缓存整个模型掩码,极大降低了内存开销。
归一化层偏置的贝叶斯化
B-Trans 的扰动靶点是归一化层(如 RMSNorm)的偏置项。论文将后归一化加性偏移视为偏置,并在后引入序列级潜变量 :
选择偏置的理由有三:偏置向量编码输入无关的 “默认先验”,调节残差流基线及激活阈值;经激活工程证实,加性向量可在不损害整体能力的情况下引导高层行为;在没有显式偏置时,模型会通过异常激活模拟类似效果。因此,对偏置施加微小偏移就能改变推理倾向,而不会破坏权重中存储的语义相关性。通过采样不同的 ,可以获得共享相同知识结构但归一化状态不同的模型实例,实现群体多样性。
代码层面,B-Trans 以轻量包装器形式替换原有归一化层,在序列开始时采样 并广播到所有时间步,序列结束后重置。这一插件式修改使骨干网络保持可微,完全兼容标准训练流程。
创新点和贡献
- 群体智能的单模型实现:首次提出将点估计 LLM 转换为可采样的模型群体,仅通过扰动归一化偏置产生功能多样性,避免了训练多个独立模型的巨额成本。
- 参数空间探索代替动作空间随机性:明确指出高温度解码只是表面扰动,真正深层探索需要在参数层面扰动模型的行为倾向。B-Trans 在强化学习环境中验证了参数空间噪声对稀疏奖励探索的有效性。
- 时间一致性噪声缓存:在自回归 Transformer 中实现假设采样,用极小的内存代价维持序列内逻辑连贯,解决了 token 级随机化导致推理碎片化的问题。
- 普适的即插即用设计:仅修改归一化层,保持与 LoRA、GRPO、VeRL 等主流训练框架的兼容性,论文在两个不同 RL 引擎(TRL 和 VeRL)上观察到一致效果。
实验结果分析
零样本多样性与创造力
在 MMLU-Pro 上,B-Trans 的 Pass@K 性能随 K 增大而显著优于高温度基线(T=1)。K=1 时两者相当,但 K>1 后 B-Trans 曲线明显更高(图 2),这意味着不同采样个体提供的额外答案多是正确的、可互补的,而非随机噪声。在开放文本生成基准 INFINITY-CHAT 上,B-Trans 产生的语义嵌入两两余弦距离更大(图 3),PCA 可视化显示它能够使模型跳出固有的语义领地,甚至偶尔进入其他模型家族擅长的区域(图 4 红框)。这表明 B-Trans 不只是扰动了表面措辞,而是改变了生成分布的基本拓扑。
强化学习探索(RLVR)
在数学推理任务(GSM8K、MATH-500、Minerva Math)上,使用 GRPO 训练时,带有 B-Trans 的 rollout 在所有四个基准上均获得一致性提升(表 1)。例如,Qwen2.5-Math-7B 的平均准确率从 61.8% 提升至 65.6%,Qwen3-1.7B 从 51.5% 到 55.7%。论文解释,GRPO 依赖组内样本的相对优势信号,同质化样本会导致梯度更新停滞;而 B-Trans 使同一组内包含来自不同参数实例的响应,更容易出现高奖励候选,从而强化学习信号。
无标签测试时强化学习(TTRL)
在最具挑战的 AIME24 数据集上,模型完全不依赖真实标签,仅通过多数投票构造奖励。B-Trans 尽管训练曲线上波动更大,但最终准确率峰值明显高于高温度基线(图 5)。深入分析指出,超参数 控制探索强度,高 允许模型进行 “头脑风暴”,更适合 AIME 这样困难的题目;而多数投票虽然表面奖励共识,但 B-Trans 提供的多样推理路径使得高奖励轨迹包含更丰富的信息,避免过拟合单一解法,从而实现更有效的自我改进。
实践建议
- 超参数调节: 是控制群体离散度的核心参数。对于确定性要求高的任务(如事实问答),可设置较小 (论文中常取 0.02 左右),维持答案准确性;对需要发散思维的任务(如创意写作、复杂数学探索),可适当增大 以获得更丰富的多样性。论文未给出最优 的自动选取方法,实践中可通过少量验证数据校准。
- 集成决策:在零样本场景下,可对同一问题采样多个 B-Trans 实例(如 K=5~20),采用投票或最佳答案选择策略,几乎不增加显存占用。这种方法适用于需要高可靠性的推理测试,如数学题求解。
- 强化学习融合:若使用 GRPO 等策略优化方法,可在 rollout 阶段开启 B-Trans 的随机性(仅前向),而更新时采用确定性的均值偏置。这样做能在不修改优化器的情况下获得更好的探索效果。论文在两个 RL 框架上都验证了可行性,推荐在数学推理、代码生成等带可验证奖励的任务中优先尝试。
- 资源敏感部署:B-Trans 的额外计算和内存开销几乎为零(仅缓存偏置噪声向量,<1MB),适合需要同时服务大量不同 “人格” 请求的 API 场景,无需为每个用户维护完整模型副本。