优化目标与搜索过程:解构优秀分词器的决定因素
Objective vs. Search: Decomposing What Makes a Good Tokeniser
论文信息
标题: Objective vs. Search: Decomposing What Makes a Good Tokeniser
作者: Ahmetcan Yavuz, Clara Meister, Tiago Pimentel
发布日期: 2026-09-16
arXiv ID: 2609.19145v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:现代语言模型常用的 BPE 和 UnigramLM 在 “优化目标” 和 “搜索过程” 两个设计轴上同时不同,导致无法判断是目标还是搜索过程影响了分词器质量。
- 核心方法:作者补齐 2×2 设计空间,提出自底向上似然算法 BottomUpLL 和自顶向下压缩算法 TopDownComp,与 BPE、UnigramLM 形成四种组合进行对照实验。
- 关键结果:在大多数实验设置下,搜索过程是主导因素——自底向上分词器在 bits-per-byte(BPB)上几乎一致优于自顶向上分词器(见论文表 2、表 3);但 BLiMP 语法判断任务上无一致关系。
- 主要局限:模型规模最大仅 1B 参数,多语言实验仅覆盖五种高资源语言,部分大模型仅单种子训练,且自顶向下删除得分使用局部替代近似。
- 适合读者:关注分词器设计、语言模型训练效率以及优化算法与搜索策略交互的 NLP 研究者、工程师。
论文背景和研究动机
现代语言模型在接收文本之前,必须把原始字符序列映射为 token 序列。这一映射由分词器完成,分词器包含词表、编码函数和解码函数。当前主流分词算法主要有两种:byte-pair encoding(BPE)和 UnigramLM。BPE 在压缩目标下自底向上地合并最频繁的相邻 token;UnigramLM 在一元对数似然目标下自顶向下地剪枝词表。
这两个算法同时沿两个正交设计轴不同:一是优化目标(压缩 vs. 对数似然),二是搜索过程(自底向上合并 vs. 自顶向下剪枝)。现有文献中,Schmidt et al. (2024) 的《Tokenization is more than compression》观察到 BPE 训练出的语言模型往往优于 UnigramLM,这一结果常被解读为 “压缩目标比对数似然目标更适合分词”。但作者指出,这种解读混淆了两个设计因素,因为 BPE 和 UnigramLM 在目标与搜索过程上都不同,不能把效果归因于单一因素。因此,本文旨在解耦这两个维度,回答 “是什么(目标)还是怎么做(搜索过程)决定了分词器的好坏”。
核心方法和技术细节
作者将分词器学习算法分解为目标函数和搜索过程两个组件。目标函数 最小化语料 token 总数, 最小化一元模型负对数似然。搜索过程分为自底向上和自顶向下两类:前者从字母表开始贪心合并 token 对,后者从超大字表开始贪心剪枝 token。
为补齐 2×2 设计空间,作者提出两个新算法:
-
BottomUpLL:采用与 BPE 相同的合并搜索过程,但每次合并的评分根据对数似然增量。论文给出精确合并增益公式(Lemma 2),其依赖 token 计数和成对频次。作者还通过一阶泰勒近似将其关联到 PMI:(Lemma 5)。这意味着被合并的 token 对不仅要频繁,还需比随机共现更显著。
-
TopDownComp:采用与 UnigramLM 相同的剪枝搜索过程,但删除 token 的评分基于压缩损失。论文给出局部替代近似下删除 token 带来的语料长度增量 (Lemma 4)。
关键区别在于自底向上的合并增益是精确的,而自顶向下的删除成本只能通过局部替代近似计算(见论文第 4.2 节)。这一不对称性是自顶向下搜索过程固有的,并非作者有意设计。论文还明确区分了 BottomUpLL 与 WordPiece、S-BPE 等相近算法的差异,指出 BottomUpLL 最接近原始 WordPiece 的描述,但不愿沿用现有多义版本(见论文第 5.1 节)。
实验设置覆盖多种词表大小(8k、32k、128k)和模型规模(100M、300M、500M、1B),英语语料来自 FineWeb-Edu,多语言语料包括英语、德语、西班牙语、土耳其语和中文。评估指标分为外在(BPB、BLiMP 最小对立语法任务)和内在(压缩量、对数似然、熵、Zipf 、词表利用率等)。
创新点和贡献
本文创新点主要有三方面。第一,首次系统解耦分词算法中的优化目标与搜索过程,而非像以往对比那样只比较 BPE 与 UnigramLM。第二,提出 BottomUpLL 和 TopDownComp 两个新算法,完成 2×2 设计空间,并为每个算法提供了可增量计算的评分公式和形式化证明(Lemma 1 至 Lemma 5)。第三,通过内在与外在评估揭示了搜索过程在 BPB 上的主导作用,并指出目标仍然影响 token 频率分布和词表组成——例如似然目标使 token 频率分布更集中,Zipf 更高,Coverage 50% 更小(见论文表 1)。这些发现为分词器的更原则性构建提供了具体证据。
实验结果分析
内在评估方面,论文发现一个有意思的现象:在 8k 小词表下,压缩目标与对数似然目标分别对应更好的压缩和似然分数;但在更大词表(32k、128k)下,自底向上方法无论其目标如何,在压缩量和一元对数似然上均优于自顶向下方法(见表 1)。作者还通过恒等式 说明熵与两个目标之间的关系。词表组成方面,图 3 显示词汇交集主要由搜索过程聚集,自底向上方法之间的词表重叠显著高于它们与自顶向下方法的重叠。
外在评估方面,在英语和多语言设置、不同模型规模下,自底向上分词器在 BPB 上几乎一致优于自顶向上分词器(见表 2、表 3)。唯一例外是英语 300M 模型在 32k 词表时,TopDownComp 以 0.0003 BPB 的微小幅度优于 BPE(表 2)。作者报告了配对文档级 bootstrap 检验确认多数差异具有统计显著性(见论文脚注 14)。这意味着在本次实验条件下,搜索过程对 BPB 的影响比目标选择更强。
然而,BLiMP 最小对立语法判断任务没有表现出类似趋势。在英语 1B 模型中,自顶向下方法反而常优于自底向上;多语言 BLiMP 中,四种分词器各自在至少一种语言上表现最佳,没有一致排序(表 3)。作者推测,在德语、西班牙语、土耳其语等形态丰富语言中,自顶向下方法可能有益,但强调这需要未来验证。
实践建议
基于本论文的有限实验范围,可以给出以下面向分词器设计与语言模型训练的建议:
-
若工程目标是最小化 BPB 或提高压缩效率,可优先考虑自底向上搜索过程。 在本次实验中,无论优化目标是压缩还是对数似然,自底向上分词器在大多数设置下 BPB 更低(表 2、表 3)。这与 BPE 作为默认选项的常见做法一致。
-
不要只关注目标函数,忽略搜索过程。 论文结果显示,在较大词表下,自底向上方法甚至能在压缩和似然两项上都超过自顶向下方法(表 1)。因此,仅把 BPE 与 UnigramLM 的差异归因于 “压缩 vs 似然” 是不准确的。
-
在小词表场景下,目标函数的选择可能仍很重要。 8k 词表实验显示压缩目标在压缩量上更好,似然目标在对数似然上更好(表 1)。若下游任务更依赖词表覆盖或 token 频率分布,需结合具体场景评估目标。
-
语法敏感任务可能需要不同取舍。 在 BLiMP 上,自底向上与自顶向下没有稳定优劣,且形态丰富语言中自顶向下可能更具优势。作者推测这一倾向值得进一步验证。
-
评估分词器时不要只看单一指标。 BPB 与 BLiMP 给出的排序不同,说明内在压缩/似然指标与语言模型外在表现并非线性对应。实际工程中宜结合下游任务、语言类型和推理成本共同决策。