工程无瑕,测量不稳:黑盒 LLM 观察者在共享端点上的预注册信度失败
Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints
论文信息
标题: Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints
作者: Haoyaun Zhu, Jie Zhang
发布日期: 2026-09-03
arXiv ID: 2609.04198v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题: 在共享推理端点上,以 LLM 为评判者(judge)作为科学测量仪器时,其稳定性假设是否成立?预注册的仪器验证阈值能否被满足?
- 核心方法: 两项预注册审计,冻结协议、阈值和请求计划,对同一模型名发送字节完全相同的请求,并用追加式审计链记录请求体哈希、响应哈希、元数据等;辅以四提供商、自托管、构造错误电池等补充实验。
- 关键结果: 两项仪器验证门均未通过:同窗口重复排名 Spearman 中位数仅 0.400(要求 0.90),次日字节相同重放全排列一致率 0.78(要求 0.99),而工程执行记录全部完美(表 2)。
- 主要局限: 所有结论基于外部可见测量,不涉及模型内部;样本来自特定合成任务家族、特定提供商和观察窗口,且历史重放字节等效性凭构造声称而非逐字节验证(第 11.5 节)。
- 适合读者: 从事 LLM-as-judge、模型评估、基准测试、可复现性工程和审计工具开发的研究者与工程负责人。
论文背景和研究动机
语言模型如今被广泛用作评判者:排名候选回答、给推理轨迹打分、门控训练数据、驱动排行榜。MT-Bench 和 Chatbot Arena(Zheng et al. 2023)确立了这一范式,但其一个基本假设——同一请求发送给同一模型名,明天读到的结果应该相同——很少被明确检验。共享推理端点的工程文献早已揭示潜在风险:服务基础设施动态批处理并发请求,常见推理内核对批大小不具不变性,模型名称背后部署可能变化。
论文作者原本的计划并非审计这一假设。一个预注册研究项目要测量可见推理前缀上的正确概率路径,但它要求观察器必须先通过仪器验证门才能进行任何科学声明。结果,两个活动都在仪器层终止:同窗口重复排名门失败,次日字节完全相同的重放门也失败。作者把这次失败转化为完整审计,用逐字节审计链揭示工程层完美与测量层不稳定之间的断裂。
核心方法和技术细节
两项预注册活动分别采用不同的观察器协议。第一代使用单映射双标签 logprob 读入,后来升级为对称映射协议:每个测量点询问两次,标签与含义的映射在两次之间反转。对称化后的读数定义为 ,映射偏差诊断量为 ,其中 。第二代则采用结构化全排列 judge:模型返回一个 JSON 对象,ranking 字段必须是十个候选别名的一个精确排列。
审计纪律是本方法的核心。所有设计常量在执行前冻结在哈希锚定的配置快照中。每次网络尝试在调用前后向只追加 JSONL 事件日志写入请求体、规范序和线序 SHA-256、原始响应及其 SHA-256、UTC 时间戳、提供商元数据、重试计数等字段(第 3.5 节)。中断运行只有在现有日志严格等于计划前缀时才能恢复;完成后生成清单,记录所有工件哈希并校验漂移。
预注册门包括 Gate I-3S(五项子标准,涵盖覆盖率、标签质量、标量重复稳定性和排名重复稳定性)和 Gate I-5R(24 小时后字节相同重放,全排列一致率阈值 0.99)。补充实验包括:A-S1 同一天与跨日方差分解(十个 100 请求窗口,同日与跨日配对);A-S2 四个提供商的同一探测电池(4,000 次调用);A-S3 构造错误电池(340 次调用,3,060 个受控判断);以及一个自托管 L2 臂,在同一模型、批量不变内核上测量安静与并发负载下的行为。
创新点和贡献
论文按照自身定位提出五项贡献。第一,完全审计的预注册负结果:两代独立仪器在冻结阈值下失败,同时执行记录完美,证明工程层证据不蕴含测量层可靠性。第二,机制分解:失败被拆解为标签语义映射偏差(M1)、近退化得分间隔(M2)和平台非确定性漂移(M3),三者被排列读入的 “放大器” 性质统一:连续小扰动越过近零间隙即变成离散、门可见的排名事件。第三,关闭两条自然逃逸路径:同一批 22 个漂移排列在三种指标下读数从 0.78 到 0.986 不等(第 6.1 节),而采样规模模拟在 到 的七个网格点上通过率为 0/500(第 7.2 节)。第四,审计边界阶梯 L0/L1/L2 与元数据失效形式:system_fingerprint 在四提供商中出现缺失、抖振、稳定但不足三种模式(第 8.1 节)。第五,仪器优先评估纪律和报告清单(第 9 节、附录 D)。
实验结果分析
表 2 并排展示了两次干净失败:I0-S 的 3,312 次计划调用全部收到响应、0 重试、0 传输错误、0 拒绝、模式有效响应率 1.0、请求体与计划 100% 哈希一致、响应元数据全部恒定;I0-R 的 100 次重放同样无任何工程缺陷。然而,Gate I-3S 的排名 Spearman 中位数为 0.400,阈值 0.90;Gate I-5R 的全排列一致率为 78/100=0.78,阈值 0.99。该对照是论文最核心的证据(图 2 总结了上下两行)。
M1 的证据来自旧版单映射协议:反转映射重复下的任务内排名 Spearman 中位数为 -0.632,而标量概率变化中位数仅 0.0233(第 5.1 节)。在 136 个遗留反转对中, 的中位数为 0.250 logits,说明偏差分量与信号本身量级相当,并且偏差与候选正确性交互。
M2 的检测限图像(图 3)显示:同一任务内四名候选读数的最小间距中位数为 ,75 分位点仍为 0.0005;而仪器噪声地板(重复对差绝对值)中位数为 0.00671,90/95 分位点为 0.052/0.080。典型间隙比噪声地板低四到七个数量级。在 84% 的任务组中所有候选共享同一正确性值,排名信息本质上不存在。模拟表明,即使每条测量点采样 500 次、总计 748,000 次调用,通过率仍为 0/500(第 7.2 节)。
M3 的漂移是局部的:22 个漂移排列中 11 个 Kendall 距离为 1,11 个距离 2–11;top-1 一致率 95/100,成对顺序一致率 4436/4500≈0.986(第 5.3 节、第 6.1 节)。A-S1 证明 “24 小时” 并未增加漂移:同日一致率中位数 0.805,跨日 0.800,差异 0.005(图 4)。A-S2 显示四个提供商的中位一致率从 0.74 到 0.879,均远离 0.99(图 5)。A-S3 的受控错误电池中,正确候选严格胜过滑移候选的分离率在各 档从 0.76 到 0.99 不等,但同一错误类型内部,分离不随错误大小单调增加;最大误差档(off-by-one,)的分离仅为 0.333,低于机会水平(第 10.3 节)。作者据此认为该读入分辨错误类型,而非错误幅度。
实践建议
对于在共享端点上构建或使用 LLM 评判器的工程团队,本文给出可直接落地的规则。第一,锁定快照身份:在 L0(仅模型名)基础设施上运行 I-5 级重放门相当于测试一个无人控制的对象;应优先自托管或提供商固定快照(L1),但 L1 仍不保证可重放精确性,必须用代表性负载实际测量(第 9.1 节)。第二,任何门在冻结前必须先导测量噪声地板和间隙分布,模拟健康与退化仪器模型下的操作特征;本文中暴露 I-5R 不可达性的先导成本约为 CNY 3,而整个审计尝试量达 52,988 次(第 9.2 节)。第三,排名门的有效分母只应包含仪器原则上可分辨的候选对,间隙必须超过预设分辨率界限;本文样本中 84% 的组本应被排除(第 9.3 节)。第四,优先使用连续读入和等价带,而非离散精确匹配门;如果下游确实需要全排列,应将聚合后的测量对象(如 Borda 分数)作为门控统计量,并对 次调用做前瞻性聚合,而不是重放到一致为止(第 9.4–9.5 节)。第五,制造可测量的被测量:候选集应通过受控错误注入确保混合正确性和足够间隔;本文运行中的候选准确率 0.781、混合覆盖率 0.163 在设计时即应被判定为不合格(第 5.2 节、第 9.6 节)。第六,报告清单必须包含快照身份级别、响应侧模型字符串分布、指纹字段状态、及对每个负载承担参数的探测行为,而不是假定文档描述有效(第 9.7 节、附录 D)。这些建议均有本文测量依据支撑,已在特定任务与平台上验证。