语义分块与自然语言的熵
Semantic Chunking and the Entropy of Natural Language
论文信息
标题: Semantic Chunking and the Entropy of Natural Language
作者: Weishun Zhong, Doron Sivan, Tankut Can, et al.
发布日期: 2026-02-13
arXiv ID: 2602.13194v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:论文试图从语义分块的角度解释自然语言的高冗余度,并揭示文本熵率的构成原理。
- 核心方法:用大语言模型递归分割文本获得语义树,再用一个单参数随机 -叉树集合模型刻画这些树的统计结构,进而从树概率推导出熵率。
- 关键结果:模型的熵率预测值与 LLM 困惑度估计的熵率高度一致,多个语料库中误差很小(图 1(d)、图 3(a)),且对儿童故事、叙事、学术摘要和现代诗等不同文体的最佳 值在 2~6 之间。
- 主要局限:为整个语料库指定单一的最优 ,不能捕捉单篇文本的差异;随机树假设忽略了不同块之间的语义依赖。
- 适合读者:对语言冗余、信息论、复杂系统以及大语言模型可解释性感兴趣的研究者,尤其是计算语言学、认知科学和统计物理方向的读者。
论文背景和研究动机
自然语言既高度结构化,又充满不确定性。读者在理解文本时,会根据上下文逐渐形成从单个词到段落乃至全文的层次化语义表征,而这种多层次结构产生了大量的统计冗余——随词可预测性使英语字符的熵率低至约 1 比特/字符,相比随机文本的 5 比特/字符,冗余度接近 80%。这一经典估计最早由香农通过 “猜字游戏” 得出,并经多年验证,但至今缺乏一个从语义组织原理出发、从头计算熵率的理论框架。
近年来,自回归大语言模型(LLM)可以用交叉熵(即对数困惑度)对文本的熵率做出可靠估计,但它们本身并不解释是语义结构的哪些方面导致了这种不确定性。与此同时,认知科学和篇章理论早就指出,文本的意义组织是层次化的,例如通过修辞结构树、连贯关系或意图结构。但这些理论大多依赖人工标注,难以大规模验证。
本研究试图搭建一座桥梁:从语义树的角度来度量文本的层次化组织,并用一个自相似随机树集合模型计算信息论意义上的熵,从而将语义结构与语言的可预测性联系在一起。作者将这一模型建立在先前关于人类叙事记忆的研究之上,其中最大的分支因子 被视为工作记忆容量参数,因此最终得到的熵率还与认知负荷紧密相关。
核心方法和技术细节
递归语义分块与语义树
论文使用 LLM 实现递归语义分块(图 1(e)–(g))。具体做法是:给定一个文本(视为一系列 token),先要求 LLM 将其分成至多 个连续、语义连贯的块(chunks);然后对每个非空块再次以同样的方式分割,直到所有叶子节点都达到单个 token 级别。这样得到一棵语义树,树叶是 token,内部节点是不同粒度的文本片段(例如段落、句子、短语)。这棵树的每个节点上记录了该片段包含的 token 数量,相当于节点的 “大小”。
在构建多篇文本的语义树后,作者把一个语料库上的所有树看作同一个随机过程的实现,并用随机 -叉弱整数有序划分过程来建模:从大小为 的根节点出发,在 token 之间随机放置 个边界,把 个 token 分成 份(允许空块),然后递归重复这一过程直到单位叶子。这一过程完全由参数 控制,为树的形状生成了一个可解析处理的概率分布。
随机树集合的概率与熵
给定一棵具体的语义树 (即各级节点的大小序列),它在随机集合下的概率由公式 (7) 给出:
其中 是大小 的父节点所有可能 路划分的数目。这个概率因子划分到各级和各节点,具有马尔可夫性。
对整个树集合,可以写出香农熵(公式 (9)):
其中 是第 层上节点大小为 的概率。表达式具有直观解释:每个内部节点贡献 的信息,而该贡献的加权因子是第 层中大小为 的内部节点的期望数量。
在文本长度 时,熵表现出渐近可加性:
就是理论的熵率,仅取决于 (图 3(a) 红色曲线)。论文补充材料中证明,对于 可以精确求解,对于大 可以通过围道积分和留数定理得到闭式近似。更重要的是,随机树集合满足渐近等分性质:在 大时,绝大多数树的归一化负对数似然都集中在 附近(图 3(b)),因此单个文本的语义树概率可以直接换算为熵率估计。
与 LLM 感知熵的比较
作为对照,作者使用 LLM 对同一文本计算每个 token 的条件对数概率并取平均,得到交叉熵率 (公式 (1))。通过多个语料库的实验,对每个语料库先用块大小分布的 KL 散度选出最佳 (表 1),再将对应的 与 比较。结果表明,二者高度吻合(图 1(d)、图 3(a)),证明从语义树模型推导出的信息度量确实抓住了 token 级可预测性的很大一部分。
创新点和贡献
-
从语义分块到熵的因果解释 以往熵率估计完全依赖基于 token 的自回归模型或人类猜字实验,而本研究首次给出一个基于语义层次化组织的自洽理论,证明 token 级的不确定性可以从段落、句子等粗粒度语义单元的划分结构中推导出来。
-
单参数随机树模型与实验的高度匹配 随机 -叉树模型由极少的假设出发,只有一个参数 ,却能同时复现出多个语料库的块大小分布以及相应的熵率。特别是,在大 极限下,层块大小的分布会收敛到对数正态分布,且通过重正化群分析证明了该分布存在普适的数据坍缩行为(图 4(b) 和 (d)),理论与实验观测一致。
-
连接语言复杂度与认知负荷 通过最优分支因子 的大小,论文区分了不同文体的语义复杂度:儿童故事 到 3,诗 ,这与人类工作记忆容量(通常认为 3–7 个块)的范围吻合,暗示可能将文本的熵率解读为理解过程中需要维持的活动语义块的数量,为认知科学实验提供定量预测。
实验结果分析
作者在五种代表性语料库上进行了实验:TinyStories(儿童故事)、FairytaleQA(童话)、RedditStories(网络叙事)、arXivAbstracts(科学摘要)和 ModernPoetry(现代诗)。主要结果如下:
-
最优 与熵率 表 1 显示最优 依次为 2、3、4、4、6,对应熵率从约 1.2 nats/token 上升到约 3.2 nats/token(图 3(a))。熵率的差异可解释文本可预测性,例如儿童故事冗余度极高( 小),而诗的信息密度大( 大)。
-
块大小分布的匹配 以 RedditStories 为例,图 2 比较了理论预测的 与实际语义树的统计,在层 等位置吻合良好;对归一化尺寸 做对数变换后,不同层的分布坍缩到标准正态分布,证实了理论中关于普遍性的预言(图 4)。
-
个体文本的波动 图 3(c) 展示 RedditStories 中 100 个故事分别用两种方法估计的熵率。虽然平均上接近 ,但短文本的树似然估计系统性地偏低,随着 增加,波动减小且两种估计都向理论值集中,符合渐近等分性质预期。
-
累积 cross-entropy 的线性拟合 图 3(d)–(f) 显示了三个语料库的累积 surprisal 随文本长度的增长。蓝色线拟合得出的斜率就是 ,而红色虚线是模型预测的 ,两者斜率极为接近。
局限与待解决问题
-
语料库均匀参数假设 模型为整个语料库分配一个最优 ,但实际文本的内部语义结构可能差异很大,有的段落逻辑复杂需要更多分块,有的则很简单。强制使用同一个 会丢失文档级别的异质性,使得单个文本的树似然熵估计精度有限(图 3(c) 的短期偏离)。
-
分块算法对 LLM 的依赖 语义分块由 LLM 执行,其质量影响着树的准确性和最终的熵估计。尽管采用了多种提示策略和人工验证,LLM 可能产生不一致或与人类理解不同的划分。论文没有系统分析不同分块策略或不同 LLM 对结果的影响。
-
树内独立划分假设 模型假设节点在自己内部的划分是均匀随机的,且不同子树之间统计独立,完全忽略了语义块之间的依赖关系,比如前后句子的因果、对比等修辞关系。这简化了统计力学处理,但可能低估了实际文本中因果信息流所贡献的额外冗余。
-
从熵率到认知负载的推断尚属猜测 论文提出 可能与工作记忆容量相关,熵率越高则理解难度越大,但这一联系停留在类比层面,没有直接的行为实验证据。未来需要设计心理语言学实验,验证在阅读不同语料库时,听众的即时记忆负载是否与模型的 预测一致。
总体而言,这项工作开创性地将语义分块与信息论度量融为一体,对语言冗余给予了极简且可量化的第一性原理解释,其理论工具(重正化群、随机树集合)也为复杂系统与认知科学的交叉研究提供了新视角。