向量策略优化:以多样性训练提升测试时搜索
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
论文信息
标题: Vector Policy Optimization: Training for Diversity Improves Test-Time Search
作者: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, et al.
发布日期: 2026-05-21
arXiv ID: 2605.22817v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:大语言模型在测试时搜索(如进化搜索、拒绝采样)中需要输出多样化的候选解,但标准的标量奖励强化学习(如 GRPO)会导致输出分布高度集中,多样性丧失,从而限制搜索效果。
- 核心方法:向量策略优化(VPO)利用任务奖励天然可分解为多个子目标的特性,在训练时随机采样不同的权重组合,并让模型在一次自回归生成中输出多个候选答案,鼓励每个答案专精于不同的奖励权衡,从而覆盖帕累托前沿。
- 关键结果:在四个不同的多目标任务上,VPO 在最佳@k 指标上匹配或超越最强的标量基线,且随着测试时搜索预算 k 的增加,优势持续扩大(见论文表 1–4 及图 3)。在 LiveCodeBench 上,VPO 使进化搜索能够解决 GRPO 根本无法破解的难题。
- 主要局限:依赖奖励的向量分解结构;牺牲了单次输出(pass@1)的性能,适用于必须引入测试时搜索的场景;训练计算量的比较不易完全公平(但论文通过给基线 3 倍计算量仍显示 VPO 占优,见第 5 节及表 5)。
- 适合读者:从事大模型对齐、强化学习后训练、推理时搜索、多目标优化框架设计的算法工程师和研究员。
论文背景和研究动机
当前,大语言模型越来越多地被嵌入到包含测试时搜索的推理流程中:从简单的 “采样多个回答并选择最高奖励者”(best-of-N),到复杂的进化搜索(如 AlphaEvolve)或树搜索(Tree-of-Thoughts)。在这些场景下,模型在训练后需要提供的不是一个单一的 “最优” 答案,而是一个高质量的候选答案池,供下游搜索算法挑选或重组。
然而,主流的强化学习后训练范式——以 GRPO 为代表的策略梯度方法——将全部奖励信号压缩为一个标量,并驱动策略向该标量奖励的高值区域收敛。这会导致输出分布严重坍塌,生成额外的样本几乎成为重复的副本,使得测试时搜索无法从更多采样中获益。这种 “探索—利用” 的失衡正是本论文试图解决的问题。
论文作者提出了一个根本性的视角转换:在后训练阶段,强化学习应该专职于维持探索和多样性,而把利用交给测试时的搜索程序。为了训练出能产生多样但高质量解集的策略,论文观察到许多实际任务中的奖励天然呈向量形式:例如代码生成中的逐测试用例正确性、多跳推理中的逐跳正确性、RLHF 中的多维评分等。这个向量结构恰好为奖励层面的多样性提供了天然的划分轴——一个理想的策略不应该只逼近单个标量峰值,而应该生成在不同奖励维度上各擅胜场的帕累托前沿解集。
核心方法和技术细节
VPO 的设计包含两个相互协同的关键组件:多答案上下文生成(multi-answer in-context generation)和基于随机标量化的集合级奖励(set-level reward via stochastic scalarization)。
多答案上下文生成
受先前工作启发,VPO 训练模型在一次自回归序列中输出 个候选答案,例如通过分隔符依次生成 <answer1>, <answer2>, <answer3>。由于后续答案能注意到已经生成的前文,模型有机会主动避开已覆盖的奖励区域,转而去探索不同的解模式。这与独立采样有着本质区别:多样性不再只是解码噪声的副产品,而是一种上下文驱动的显式机制。
随机标量化的集合级奖励 如果仍然用固定标量奖励去评估这组答案,模型依然会驱使每个答案朝着同一个标量最优方向靠拢,多样性名存实亡。VPO 的解决方案是从单纯形上均匀采样不同的权重向量 ,定义一组答案的集合奖励为在这些随机权重下最优元素的平均得分:
直观上,如果一个集合里的答案全都集中在奖励空间的某个角落,它只能在少量 采样下获得高分;而覆盖多个奖励权衡方向的集合,能在大量权重采样下持续出色。该奖励直接鼓励模型学习生成覆盖帕累托前沿的候选集。
VPO 可作为 GRPO 的优势估计器的即插即用替换。对一组提示,采样 组答案集(每组 个答案)和共享的 个权重样本,计算各集的蒙特卡洛集合奖励,再通过 GRPO 的组内标准化方式得到优势信号,应用于整个答案集生成序列的每个 token。
创新点和贡献
- 训练目标的范式转换:明确提出在后训练中应将探索与利用的职责分离,由测试时搜索承担 “利用”,训练阶段专注于保持奖励多样性。这在 “搜索增强推理” 日渐普遍的当下具有重要的实践指导意义。
- 利用天然向量奖励实现结构化多样性:并非通过熵正则等间接手段艰难维持多样性,而是直接利用许多任务中已有的多维度奖励结构,将优化变成一个 “覆盖帕累托前沿” 的问题。这种 reward diversity 比表面词汇多样性或噪声采样多样性更能直接服务于下游搜索的需求。
- 简单的算法集成:VPO 本质上只是改变了 GRPO 优势估计中奖励的计算方式,无需引入额外网络、复杂的解耦训练或精心设计的提示词。这使其易于在现有的 RLHF 管线(如 veRL 等框架)中落地。
- 多答案上下文探索与集合奖励的协同:论文证明,仅有上下文多答案生成(如 Multi-RLVR)会因为固定标量奖励而再次塌缩,仅有随机权重单答案训练则因缺乏集合级分配而产生不稳定。二者结合才形成一个稳定、可产生真实专业化的训练信号。
实验结果分析
论文在四个具有不同向量奖励特性的域上进行了全面评估:
- Maze(迷宫导航):人工构建的栅格任务,迫使模型在获取多种宝物和避开岩浆之间做出取舍,并验证即使在训练时使用随机权重,VPO 在评估固定标量奖励时仍超越直接用该标量训练的 GRPO(表 2)。这解释了维护多样性反而能帮助寻找到更优的最终标量解。
- MuSiQue(多跳阅读理解):奖励由四个证据引用的二元指标和一个答案 F1 组成。VPO 的 best@30 达到 0.832,显著高于 GRPO 的 0.728 和专门为 max@k 设计的 Max-at-K 训练(表 1)。随着样本数 增加,VPO 的优势持续扩大(图 3),揭示了其多样性的直接收益。
- EUREQA(链式推理):因果链要求依次预测实体,每个实体一个二元指标。VPO 在 best@30 达到 0.279,超越所有基线(表 3)。有趣的是,Multi-RLVR 在该任务上表现接近 VPO,且其训练期奖励空间多样性也较高(见论文图 6),反证了多样性对性能的决定性作用。
- ToolRL(函数调用):奖励含格式、工具名、参数键、参数值四个维度,易到难排列。VPO 在 best@10 获得 0.950,优于 GRPO 和 Max-at-K(表 4)。
- 极限推演:LiveCodeBench 及进化搜索:在严格时间切分的编程基准上,VPO 在 pass@k 指标下超越 GRPO(图 4A,B)。当嵌入 OpenEvolve 进化搜索框架,处理两个基线在 best@30 均为 0 的极难题时,VPO 持续发现新解,GRPO 则早早停滞(图 4C,D)。这证明了 VPO 的多样性对强搜索算法的支撑作用。
论文还通过一系列消融实验(第 5 节)排除了 “多答案生成本身”、“更优归因”、“目标条件化提示” 等替代解释,并定量指出:当奖励维度高度线性相关时(如 UltraFeedback 的某些评分维度),VPO 的优势消失,这与其依赖多维度之间存在真实权衡的前提一致(表 9)。
实践建议
对于已经或计划在系统中引入测试时搜索(best-of-N,进化搜索,树搜索等)的团队,VPO 提供了一条明确的落地路径:
-
奖励分解:梳理任务中可被自然向量化的指标。典型的候选包括:不同测试用例的通过/失败、不同考点的得分、不同用户偏好的评分、不同工具调用的子指标等。如果各维度实际上高度相关,VPO 的收益有限,此时可尝试重新构造更有区分的奖励维度。
-
训练实现:VPO 对现有 GRPO 管线的改动极小。在实现中,只需将标量奖励替换为对每组 个答案计算随机标量化的集合奖励,再送入优势估计器。建议 设为 3 左右,权重采样数 可与 rollouts 数相同以实现批量共享。务必保证训练和评估的采样温度足够大,以发挥多样性潜力。
-
应用场景选择:VPO 会牺牲单次输出(pass@1)的表现,因此仅适用于测试时有预算和搜索机制的场景。若业务中每次只能调用一次模型且不允许后处理,标准标量训练更合适。建议在离线后用 best@k 或进一步搜索的效果来对比新旧策略。
-
与进化搜索或 best-of-N 集成:实验表明,当搜索算法本身足够强大(如 OpenEvolve),VPO 提供的多样性能解锁标量训练无法触及的问题。因此,对于需要解决高难度、开放性任务的系统(如算法发现、复杂代码生成),应考虑将 VPO 训练的模型作为生成器。
-
监控与衡量:在生产中,除了直接的成功率,应持续监控候选池的奖励空间多样性(如平均成对距离),这可以作为训练过程是否崩塌、是否需要调整参数或重新训练的有价值信号。