轨迹上的信息:鞅与随机时间

Information on trajectories: martingales and random times

arXiv: 2608.20337v1

论文信息

标题: Information on trajectories: martingales and random times

作者: Akshay Balsubramani

发布日期: 2026-08-20

arXiv ID: 2608.20337v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决鞅浓度不等式在推导中 “丢弃了多少信息” 的核算问题,尤其是任意随机时间下的信息流与经典尾概率界的残差。
  • 核心方法:把混合重合恒等式放到非负鞅的路径空间上,将经典不等式写成 “恒等式减去可命名残差”,并用 Gibbs 倾斜、幂均证书和可选停时三种几何分别解释残差。
  • 关键结果:Ville 不等式被恢复为精确首达恒等式 P(sup⁡tMt≥x)=1x(1−E[Jx1{σx<∞}])\mathbb{P}(\sup_t M_t \ge x)=\frac{1}{x}(1-\mathbb{E}[J_x\mathbf{1}_{\{\sigma_x<\infty\}}])(论文定理 4.7),离散步鞅的缺口就是过冲均值除以水平。
  • 主要局限:主要框架建立在离散时间非负鞅上;Doob LpL^p 不等式不能统一到相对熵残差,而是需要单独的幂均证书几何。
  • 适合读者:研究鞅浓度不等式、anytime-valid 检验、安全测试、PAC-Bayes 边界及随机时间统计推断的概率论与机器学习读者。

论文背景和研究动机

经典鞅浓度不等式通常通过丢弃非负项来证明,例如 Ville 不等式、Azuma–Hoeffding、Bennett–Bernstein–Freedman、PAC-Bayes 以及 Doob LpL^p 极大不等式。这一过程会损失信息,但损失的是什么、损失多少,通常没有被精确刻画。本文的出发点是:每一步被丢弃的非负项都对应一个可以命名的信息量。作者把 “混合重合恒等式” 放到路径空间上,使非负鞅的 Rényi 矩、跨水平尾概率和随机时间惩罚都成为同一个变分等式的特殊情形。

论文的目标不是否定这些经典不等式,而是把每条不等式恢复为精确恒等式,并写出被丢弃残差的闭式。这样既能量化经典界的保守程度,也能在不同测试鞅或多个模型之间比较证据强度。

核心方法和技术细节

核心工具是混合重合恒等式。给定因子 πi\pi_i 和指数 αi\alpha_i,混合配分函数为 Z(α)=∫∏iπiαi dνZ(\alpha)=\int\prod_i\pi_i^{\alpha_i}\,\mathrm{d}\nu,Gibbs 混合密度为 pα∗=∏iπiαi/Z(α)p_\alpha^*=\prod_i\pi_i^{\alpha_i}/Z(\alpha)。对任意分布 pp,恒等式给出

log⁡Z(α)=∑iαiEp[log⁡πi]−D(p∥ν)+D(p∥pα∗)\log Z(\alpha)=\sum_i\alpha_i\mathbb{E}_p[\log\pi_i]-\mathrm{D}(p\|\nu)+\mathrm{D}(p\|p_\alpha^*)

其中 D\mathrm{D} 是相对熵。该恒等式的路径空间版本(论文定理 3.2)将因子取为 FT\mathcal{F}_T 可测随机变量,把任意路径测度 QQ 的自由能读取误差写成与 Gibbs 路径倾斜的散度。若因子是一步似然比 RtR_t,则得到序列混合重合恒等式(论文定理 3.3),最大收益由 Gamma 倾斜 Rα∗R_\alpha^* 唯一取得。

论文进一步用链式法则把路径散度分解为逐期条件散度(推论 3.4),使一步最优条件密度成为 ptp_t 与 qtq_t 的局部几何混合,并带有一个把未来指数请求折回当前的 hh-变换因子。

在浓度不等式方面,论文用运行条件对数累积量生成函数 Ψt(λ)\Psi_t(\lambda) 构造指数鞅 Et(λ)=exp⁡(λYt−Ψt(λ))\mathcal{E}_t(\lambda)=\exp(\lambda Y_t-\Psi_t(\lambda))。精确累计量下,熵恒等式为

λEQ[Yt]−EQ[Ψt(λ)]+D(Q∥Qt⋆)=D(Q∥P∣Ft)\lambda\mathbb{E}_Q[Y_t]-\mathbb{E}_Q[\Psi_t(\lambda)]+\mathrm{D}(Q\|Q_t^\star)=\mathrm{D}(Q\|P|_{\mathcal{F}_t})

其中 Gibbs 倾斜 Qt⋆Q_t^\star 的参数是 Et(λ)\mathcal{E}_t(\lambda)。当可预测累计量被一个可计算主控项 Ψ‾t(λ)\overline{\Psi}_t(\lambda) 替代后,精确等式放松为不等式,缺口包含倾斜次优性和累积量替换两项(论文命题 4.2)。

Ville 不等式则通过与首达时间相关的精确恒等式恢复。对趋于零的非负鞅,首达概率为

P(sup⁡tMt≥x)=1x(1−E[Jx1{σx<∞}])\mathbb{P}(\sup_t M_t \ge x)=\frac{1}{x}\left(1-\mathbb{E}[J_x\mathbf{1}_{\{\sigma_x<\infty\}}]\right)

其中 Jx=Mσx−xJ_x=M_{\sigma_x}-x 是过冲量(论文定理 4.7)。因此,连续路径无过冲时达到 Pareto(1) 尾部;离散步进则保留过冲损失。

Doob LpL^p 极大不等式不能由 Gibbs 倾斜得到,而需要 Azéma–Yor 证书族。对 p>1p>1,证书 U(x,y)=yp−qyp−1xU(x,y)=y^p-qy^{p-1}x 使逐次纪录的 Bregman 散度给出可选停时缺陷,Hölder 转换再给出单独缺陷。推论 5.2 把 Doob 缺口分解为 Hölder 缺陷、可选停时缺陷和初值三项。

创新点和贡献

论文的主要贡献是把多个经典不等式放进同一个 “恒等式减残差” 框架。具体包括:

  1. 统一路径空间会计:定理 3.2 为任意 FT\mathcal{F}_T 因子给出自由能上限,并把所有经典界解释为该等式的特定读取。
  2. 残差闭式:Ville 首达残差是过冲均值(定理 4.7);Azuma–Hoeffding 残差包含事件放松、倾斜次优和累积量替换三项(论文第 4.3 节);PAC-Bayes 残差是后验到运行 Gibbs 倾斜的散度(论文定理 4.10)。
  3. 随机时间 peeking penalty:任意随机时间在路径-时间空间上引入一个额外因子,该因子度量预期性;在停时处为零,在伪停时处对一致可积鞅也恰好为零(论文第 7 节)。
  4. 多模型池化收益:WW 个测试鞅的几何混合是一个超鞅,其 Ville 界由多路重合散度收紧;池化后跨水平的精确概率写成 Ville 基线减去三个可命名项(论文推论 6.2)。
  5. 凝聚解释:对整数指数,配分函数可解释为独立副本共享路径前缀的概率,其增长在有限状态 Markov 族中由 Perron–Frobenius 谱半径控制(论文命题 3.8)。

实验结果分析

论文主要是理论工作,实验部分用于说明和验证残差的实际行为,不是大规模基准评测。图 1 给出四类残差的几何特征:路径 PAC-Bayes 松弛在 Bayes 后验处为零,在 prior-anchored 后验处增长;高斯测试鞅在运行最大处读取时,预期性惩罚为 0.7390.739 纳特;Doob LpL^p 经过对数后得到一个加法预算 log⁡pp−1\log\frac{p}{p-1};池化 WW 个测试鞅的多路重合散度随水平和投注者数量增长。

图 2 用真实语言模型补全说明凝聚自由能:对 Qwen2.5-0.5B 的 2000 个补全,在两个未被题目决定的槽位处,自由能分别上升 1.181.18 和 2.722.72 纳特,而确定槽位的成本在 0.0150.015 到 0.0690.069 纳特之间。该实验支持 “自由能在路径真实分叉处上升” 的读数,但仅针对这一个语言模型和这一条提示。

图 4 在 Gaussian stream 混合测试中显示,达到不同证据水平的路径比例受效应大小影响,但达到同一水平所需的中位信息支出差异较小。在最深水平处,三个效应组的到达比例相差 210210 倍,而中位支出差异为 1.661.66 倍。作者据此说明 “效应大小决定到达频率,但几乎不改变达到给定水平的信息成本”;这是该模拟设置下的有限观察,不代表一般数据流。

局限与待解决问题

本文的核心限制是它主要处理离散时间非负鞅。连续时间结果作为理想化出现:Ville 尾部要精确达到 1/x1/x 需要连续路径无过冲,而论文指出任何离散时间消失鞅不可能在所有水平上同时达到该界(论文第 4.2 节)。因此,离散到连续的校正对实际测试仍然重要。

Doob LpL^p 极大不等式无法进入相对熵几何,而是需要单独的幂均证书。论文虽然对一般证书给出了残差分解(命题 5.3),但表 1 中 Burkholder–Davis–Gundy 和 Burkholder–Rosenthal 等行的残差只被命名,并未在一般 pp 下显式计算。这意味着当前框架对 LpL^p 族的量化收益仍不完整。

随机时间的 peeking penalty 依赖时间预期性指标,最坏情况需要对 e-process 类取上确界(论文第 7 节)。论文给出了概念和若干精确界,但对一般随机时间的可计算性没有进一步说明。多模型池化的精确跨水平概率包含 Doob 分解项和过冲项,实际应用中需要估计这些量,论文未提供统一的估计程序。