CommCP:通过基于大型语言模型的通信与保形预测实现高效多智能体协调
CommCP: Efficient Multi-Agent Coordination via LLM-Based Communication with Conformal Prediction
论文信息
标题: CommCP: Efficient Multi-Agent Coordination via LLM-Based Communication with Conformal Prediction
作者: Xiaopan Zhang, Zejin Wang, Zhixu Li, et al.
发布日期: 2026-02-05
arXiv ID: 2602.06038v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:论文要解决多台异构机器人通过自然语言通信协作完成具身问答任务时,由于大语言模型输出过度自信或无关信息导致通信效率低下、探索冗余的问题。
- 核心方法:提出 CommCP 框架,将大语言模型生成的消息用共形预测进行校准,只发送机器人高置信度认为对队友任务有实际帮助的目标或相关物体信息。
- 关键结果:在两机器人场景中,CommCP 在归一化时间成本 0.4 时成功率达到 0.68,而基线 MMFBE 需要 0.8 的归一化时间才能达到 0.65 的成功率,效率提升近一倍(图 3a)。
- 主要局限:验证仅限 2~3 台机器人、基于 Habitat 模拟器的 70 个场景;未在真实机器人上部署;共形预测校准集依赖人工标注,模型本身只使用了较小的开源语言模型。
- 适合读者:从事多智能体协作、具身人工智能、大模型可信通信以及机器人探索规划的研究者与工程师。
论文背景和研究动机
在家用服务机器人场景中,用户可能同时向多台具有不同操作能力的机器人下达任务,例如 “关掉电视”“把红色靠垫拿到卧室”。机器人需要主动探索环境、提问并推理出答案,这就是具身问答(EQA)。现有工作多集中在单机单任务,而现实中多机器人协作的自然方式是通过语言共享观察与推理,避免重复探索。
然而直接将大语言模型(LLM)用于多智能体通信会带来严重问题:LLM 经常输出过度自信但不可靠的消息,或者在看到物体时不加过滤地广播,导致队友被误导或收到无关信息,反而降低整体探索效率。论文将此定义为多智能体多任务具身问答(MM‑EQA)问题,并指出通信的质量远比数量重要。因此急需一种机制来校准机器人在通信时的 “不确定性”,确保发出的每一条消息都是高可靠、高相关的。
核心方法和技术细节
CommCP 是一个去中心化的通信框架,在每台机器人的感知‑规划闭环中插入一个带共形预测的消息生成与校准模块。整体流程如下:
-
感知与对象检测:机器人使用视觉语言模型(VLM)分析当前 RGB 图像,输出观察到的物体列表(名称与颜色),同时 VLM 也为本体问题生成答案候选及其预测概率。
-
基于 LLM 的对象相关性推理:当机器人收到队友发来的援助请求(包含队友想找的目标物体集合)后,调用 LLM 逐一评估自己看到的每个物体与队友目标的语义关联性。LLM 必须从 A(同一物体)、B(高度相关,目标可能在附近)、C(不相关)、D(常见背景)中选择一项,并给出该选项的生成概率。整个推理过程通过零样本思维链提示完成,明确要求 LLM 结合典型居家场景中的物品共现规律给出分析。
-
共形预测校准:LLM 输出的概率往往未校准,容易导致误报。CommCP 为选项 A 和 B 分别构建了独立的校准集:从 20 个不同的 HM3D 场景中采样(观察物体,目标物体)对,用人工标定真实的空间关联性,再运行同一 LLM 获得概率值。对于新场景中的测试样本,计算其概率值,仅当概率高于校准集 分位数时,才将对应物体纳入被允许发送的预测集。这意味着消息的可靠性受到统计保证,即真值以不低于 的概率被包含在通信内容中(见论文第 IV‑B 节)。
-
消息构造:如果校准后的集合非空,机器人用模板生成自然语言消息,如 “我看到红色靠垫可能与你找的红熊靠垫有关”,并附上物体的近似位置;如果所有选项都被过滤掉则不发送任何消息,避免提供无意义信息。
-
探索与规划融合:每台机器人维护一张二维语义价值(SV)地图,初始时仅基于自身 VLM 的前沿点(frontier)语义估计。一旦收到队友的消息,会根据消息中提供的相关物体和目标物体计数,加权更新对应前沿点的通信语义值 ,并与自生语义值取较大者。整个地图经高斯平滑后指导机器人采用基于前沿的探索规划器,使其优先前往信息价值高的区域。同时机器人还可以在满足信心阈值 时,将自身已确认的答案直接发送给相关队友,避免对方重复探索(见论文第 IV‑D 节)。
-
终止条件:一旦机器人回答完所有分配给它的任务(无论是自行解答还是从队友处获得高置信度答案)便停止探索,或达到最大时间上限。
创新点和贡献
论文主要有三项贡献:
- 首次定义 MM‑EQA 问题:将多机器人信息收集过程形式化为多智能体多任务具身问答,比传统单机 EQA 更贴近真实居家协作场景。
- 引入共形预测校准通信:首次将共形预测用于多智能体协作的消息生成,从统计上控制通信内容的可靠性,既保留了 LLM 的语言泛化能力,又避免了因模型臆造导致的误导和带宽浪费。
- 开源基准与充分实验:基于 HM3D 构建了包含 420 个问题、70 个场景的 MM‑EQA 基准,覆盖位置、辨认、计数、存在性和状态五类问题,并开源代码、数据集与视频,为后续研究提供统一参照。
实验结果分析
实验在两机器人设置下对比了 CommCP 与两种基线:无通信的多智能体多任务前沿探索(MMFBE)和多智能体单机版 “探索到自信为止”(MMEuC),并进行了多项消融实验。
- 整体性能:CommCP 在归一化时间成本 0.4 时达到 0.68 成功率,而 MMFBE 即使在 0.8 才达到 0.65;MMEuC 因完全无通信,效率更低。实际完成时间上,CommCP 平均 445 秒,MMFBE 为 594 秒(图 3a)。
- 共形预测的作用:去除共形预测的 Ours‑No‑CP 几乎退化为 MMEuC 水平,表明未校准消息严重误导了机器人(图 3b)。同样,若仅控制通信数量而不保证质量(Ours‑Com‑Control),性能同样大幅下降,证明关键在消息的相关性而非数量(图 3c)。
- 答案共享的影响:禁止共享高置信度答案后,机器人需要自己探索解答所有问题,导致成功率下降且收敛变慢(Ours‑No‑Answer‑Sharing,图 3c)。
- 场景规模化:在面积超过 250 m² 的大场景中,CommCP 相比 MMFBE 的归一化时间优势扩大到 0.6,说明信息共享的价值随环境复杂度增加而放大(图 5)。
- 通信延迟:在每秒 0.25~4 条消息的不同发送速率下,CommCP 在各速率下均优于 MMFBE,高发送速率能在前期更快提升成功率,但最终成功率趋同(图 3d)。扩展到三机器人时,CommCP 仍保持明显优势,而未校准方法在前期因信息过杂出现成功率下降(图 3e)。
实践建议
对于有意在真实多机器人系统中引入语言通信的团队,以下实践要点值得参考:
-
永远不要直接信任原始 LLM 输出:当前的大模型在物体关联性判断上容易过度自信,必须加入校准机制。共形预测只需少量带标定的小型校准集即可提供可靠的统计保证,可集成到通信模块中,所需标注成本不高(论文使用 20 个场景的物体对)。
-
质量高于数量:实验清楚表明,控制通信数量(Ours‑Com‑Control)而不保证内容质量,效果甚至不如不通信。因此实际系统中应优先确保消息可靠,而不是让机器人频繁广播所有观测。可以设置一个置信度阈值,低于此值的物体信息一律抑制。
-
支持答案共享以减少冗余:如果某个机器人已经以高置信度回答了队友的任务,直接告知队友能让后者停止无效探索、转向其他任务,显著缩短整体任务完成时间。
-
场景越大,通信价值越高:在大型室内环境(如办公楼、商场)部署时,协作信息共享的效率增益格外突出,建议尽早引入基于共形预测的过滤式通信。
-
考虑通信延迟与信息刷新:虽然论文显示不同发送速率下最终成功率一致,但在实际系统中,通信延迟、带宽限制会较大影响收敛速度。可将语义价值更新与消息接收异步化,并在规划时对远处消息附带的不确定性进行相应折扣。