COVER:可识别的联盟路由评估
COVER: Identifiable Evaluation of Coalition Routing
论文信息
标题: COVER: Identifiable Evaluation of Coalition Routing
作者: Raghul Sugumar, Amrit Gopinath
发布日期: 2026-08-28
arXiv ID: 2608.28475v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:多智能体系统更换团队时,端到端准确率差距无法识别 “联盟路由效应”,因为下游消息和最终器也会随之改变。论文要分离出可识别的联盟选择评估量。
- 核心方法:提出 COVER 评估合约,预先固定公开信息边界、下游执行栈 和有限合法团队族,然后完整执行合法团队或冻结策略路由并集,用查表方式计算有限基准后悔。
- 关键结果:在 ToolSandbox 五家族变体偏移验证中,前瞻冻结路由器完成率为 0.637、后悔为 0.131,未达到预设 0.10 标准;而声明家族 oracle 完成率为 0.768(见论文第 6 节)。
- 主要局限:受控基准的结果来自构造定义的证据覆盖,不等价于自然智能体效用;自然验证只有 14 个任务变体;回顾性比较器不能升级为前瞻结果;一次性 provider 执行也不是总体效用(见第 9 节)。
- 适合读者:多智能体系统、LLM 路由、评估方法论、因果推断与实验设计方向的研究者和工程负责人。
论文背景和研究动机
在常见的多智能体路由评测中,如果两套系统选择了不同 worker,并且其中一套最终准确率更高,通常很难说这种优势来自 “更好的团队选择”。原因在于:改变团队的同时也会改变私有消息、通信顺序和最终器输入,下游合成阶段并非保持不变。因此,端到端准确率差距本身无法识别路由选择效应。
COVER 的目标是把这个问题缩小到一个可识别的范围:对一个任务 ,给定合法团队族 ,以及一个完全固定的下游栈 ,只改变所选联盟 ,观察结果 。在这个设定下,有限基准后悔可以定义为
其中 是路由器选择的团队。论文强调,这种 “精确性” 是栈内部的:它不表示团队排序在更换 后仍然不变,也不识别随机部署效用。
相关工作部分区分了几个容易被混淆的对象:模型路由、通信拓扑、顺序策略、团队选择、联合系统设计等。COVER 只针对 “在共同下游协议下、声明有限联盟族” 的选择效应,而不是声称要解决所有被称作 routing 的问题。
核心方法和技术细节
COVER 合约要求对每个任务固定五件事:动作空间、信息边界、下游协议、覆盖率、推断方式。信息边界特别关键:路由器在选择团队时只能看到任务文本和公开能力卡,不能看到私有证据、答案、必选团队标签或已收集的结果(见表 1)。
覆盖率又分为两种目标。若目标是绝对有限基准 oracle 后悔,则必须执行所有合法团队。若目标是比较一组已冻结策略的相对差异,则只需执行这些策略实际选择的不同团队的并集。论文通过形式化证明给出最小支持结论:在所有有限结果仍落在 的前提下,当至少两个策略选择不同团队时,要逐点识别所有成对对比,执行支持必须包含路由并集;该并集本身又已经足够,因此它是唯一包含最小的无假设设计(见附录 A 的定理 1 证明)。但该设计不能识别绝对 oracle 后悔。
当覆盖率不完整时,论文给出有限行动表的精确识别区间:
其中 是已观测团队中的最大值。只有完整覆盖时才退化为点值;否则端点可由两个与观测结果完全一致的表分别达到。这个结果说明了为什么 “查表” 是这类有限基准 regret 的通用识别路径,而部分覆盖只能报告采样行动后悔或区间边界。
实验中,论文使用两个受控干预表:MuSiQue-12 有 500 个 held-out 任务、每任务 220 个规模为三的合法团队;HotpotQA-4 有 300 个 held-out 任务、每任务 4 个规模为三的合法团队。两者的符号化最终器都只检查构造定义所要求的证据是否被选中,源 ID 在训练/开发/held-out 之间不相交(见第 4 节)。这使完整枚举的结果精确,但也意味着它测量的是构造证据覆盖,而不是自然 agent 效用。
创新点和贡献
论文的主要贡献不是提出一个新的路由器架构,而是提供一个可审计的测量方法。其创新点可以概括为:
第一,将 “有限基准后悔” 与 “部署效用” 分开,并用信息边界和下游栈固定来避免移动管道混淆。第二,给出最小支持定理,明确区分绝对 oracle 后悔与冻结策略相对对比所需的覆盖率,二者不能互相替代。第三,在两个完整受控表中演示了该合约的敏感性和基准对比;例如 HotpotQA-4 中直接集合评分器的后悔为 0.1100,而 leave-one-out 基线为 0.3133,配对增益为 0.2033,CI 为 [0.1533, 0.2567](见第 4.2 节)。第四,在固定栈真实执行中把已验证证据运输和原始答案增益拆开,说明路由改善可能被弱 finalizer 掩盖。第五,在 ToolSandbox 自然工具环境中区分 “测量 headroom” 和 “已实现路由性能”,即使最终路由基准未达标也完成了有效测量。
实验结果分析
在 MuSiQue-12 中,预指定的特权正控制接口从 0.532 降至 0.402,说明在提供潜在组件成员标签时,结局表对全局补全敏感。但该标签属于基准构造特权信息,不是可部署标签。后来设计的公开接口达到 0.424,对比其匹配图 0.554,但这是回顾性结果,不能替代前瞻验证(见第 4.2 节)。
在 HotpotQA-4 中,直接集合评分器的后悔为 0.1100,低于 leave-one-out 基线 0.3133。论文将其解释为四选一决策中的归纳偏置和样本效率证据,而不是证明直接集合评分已经解决大规模联盟路由。
真实执行部分使用了 Llama 固定栈。已验证证据完整率的路线后悔改善为 0.190,CI [0.140, 0.240];但原始精确答案增益仅为 0.010,CI 为 [-0.0067, 0.0267],区间跨零(见表 5)。这显示更好的路线可以提升证据运输,却未必转化为最终答案优势。交叉栈诊断进一步表明绝对分数依赖 finalizer,但在两 finalizer 面板中未检测到路由器与 finalizer 的交互(见第 5 节及表 10)。
ToolSandbox 的五家族验证是最接近自然环境的测试。14 个任务、每任务 16 个声明联盟,共 224 行全部有效。声明家族 oracle 完成率为 0.768,前瞻冻结能力路由器为 0.637,后悔 0.131,未通过 0.10 阈值;事后比较器达到 0.655,与 all-workers 相同,但平均 worker 数从 5.00 降至 4.57。该比较器属于回顾性套件,不能作为前瞻成功证据(见第 6 节)。
实践建议
对于希望在多智能体路由中做严格评估的团队,COVER 提供了一套可操作的做法。首先,在开始收集结果之前,要声明合法团队族、公开信息边界和下游协议,并冻结路由器。否则很容易把下游变化误认为选择效应,或者把事后比较器包装成前瞻发现。
如果动作空间较小且枚举成本可接受,优先执行所有合法团队。这样才能报告有限的绝对 oracle 后悔;如果只报告采样行动后悔或路由并集对比,应明确说明识别对象不同。若动作空间很大,可以预先承诺一个抽样设计,记录包含概率,并在较小的重叠队列上对照全枚举结果,以校准采样偏差。
在报告结果时,应区分三类结论:有限受控选择表、固定生成条件下的证据传输、随机执行下的最终任务成功。三者有关联但不能互相替代。论文的 Llama 实验表明,证据传输增益不一定转化为原始答案增益,因此在真实执行中最好同时报告已验证端点和原始答案端点。
此外,声明家族 oracle 上限并不等于已实现路由性能。ToolSandbox 中 0.768 的 oracle 只能靠事后逐任务查表获得;前瞻路由器只有 0.637。因此,实践报告应同时给出 oracle、已实现策略性能和两者之间的后悔,避免把治疗变异误解为路由成果,也不要只报告已实现性能而隐藏可利用的异质性。