面向 Transformer 语言模型的值感知数值表示

Value-Aware Numerical Representations for Transformer Language Models

arXiv: 2601.09706v1

论文信息

标题: Value-Aware Numerical Representations for Transformer Language Models

作者: Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu

发布日期: 2026-01-14

arXiv ID: 2601.09706v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决 Transformer 语言模型在基本数值理解和算术运算上的脆弱性。尽管模型能在复杂数学推理基准上取得好成绩,却常在简单数值比较(如错误判断 9.11 > 9.9)和基础算术上出错,根源在于模型将数字作为符号化 token 处理,未显式编码数值大小。

  • 核心方法:在数字的文本 token 序列前插入一个特殊的 <num> token,其嵌入向量由一个可学习的模块根据数值大小显式计算得出(emb(<num>)=f(x)emb(<num>) = f(x)),向模型直接注入数量级信息,训练时使用三部分复合损失对齐训练与推理行为。

  • 关键结果:所提方法的 RNN 变体在 NUPA 基准测试上达到 0.724 的 Exact Match 准确率,比标准 Transformer 基线(0.687)提升超过 3 个百分点,且在不同数字位数和任务类型上表现一致(表 1, 表 2)。

  • 主要局限:实验仅在从零训练的小规模 GPT-2 架构上进行,未在大型预训练模型上验证;训练需两次前向传播,训练成本翻倍;未进行专项超参数调优。

  • 适合读者:从事大语言模型、自然语言处理、数值推理优化的研究人员和工程师;关注如何在神经网络中编码结构化先验知识的机器学习从业者。

论文背景和研究动机

当前基于 Transformer 的大语言模型在数学基准测试上表现亮眼,但这种印象并不完整。越来越多的实证证据表明,模型在基础数值理解和简单算术任务上频繁出错——它们能生成令人信服的推理链,却在诸如 “9.11 与 9.9 谁大” 这类问题上犯错。Yang 等人的工作进一步指出:多数数学基准混淆了高层次推理(问题解释、方程构建)与低层数值处理,后者的缺陷常被前者掩盖。

问题的根源在于 Transformer 的数字表示方式。对人类而言,数字具有与书写形式无关的内在量值;但对模型来说,数字只是若干 token 序列,其数值语义仅从文本分布统计中间接涌现。模型逐片段处理数字而非将其作为统一量值,这导致在比较、量值估计和算术上伴随输入长度增长出现系统性错误。即使用更多推理 token 也无法解决模型内部缺乏可靠数值表示的核心缺陷。

研究者们已从多条路径尝试改进:修改推理过程、引入形式化语言模块、使用专门的位数标注格式、采用回归式损失函数等。但这些方法要么绕过数字表示本身而试图通过外部推理补偿,要么仅在文本层面添加辅助信息而没有显式编码数值量大小。在此背景下,本文提出了一种直接向输入空间注入数值信号的思路。

核心方法和技术细节

该方法的核心设计是:在每个数字的文本 token 序列(如 [1][4])之前插入一个特殊 token <num>。该 token 的嵌入并非固定学习的向量,而是由一个可训练模块 ff 根据真实数值 xx 计算得出:emb(<num>)=f(x)emb(<num>) = f(x)。如此,数量信息作为一个连续信号注入模型输入端,与原有的符号化 token 嵌入并行存在。

对嵌入模块的设计,论文探索了两类方案(图 3):

  • MLP 编码器:将数字的整数和小数部分表示为固定长度的十进制向量,经填充后通过前馈层投影;
  • RNN 编码器:用独立的 GRU 分别处理整数和小数部分的变长数字序列,拼接两者的最终隐藏状态,再附上符号、位数、小数位数等辅助特征并通过线性层映射到模型隐藏维度。

推理时模型需自行预测 <num> token,此时无法获取真实数值。为此引入一个可学习的投影模块 proj(h)proj(h),将当前位置的隐藏状态 hh 映射到嵌入空间,以代替 f(x)f(x) 用于后续解码。

训练的核心挑战在于训练-推理不一致:训练时模型可使用真实数值嵌入 “作弊”,推理时却只能依赖投影嵌入。为此论文设计了包含三个分量的总损失函数:

L=LLMemb+LLMproj+λLrec\mathcal{L} = \mathcal{L}_{\text{LM}}^{\text{emb}} + \mathcal{L}_{\text{LM}}^{\text{proj}} + \lambda \mathcal{L}_{\text{rec}}
  • LLMemb\mathcal{L}_{\text{LM}}^{\text{emb}}:标准语言建模损失,<num> 嵌入由真实值编码器提供;
  • LLMproj\mathcal{L}_{\text{LM}}^{\text{proj}}:另一轮前向传播,<num> 嵌入替换为 proj(h)proj(h);
  • Lrec\mathcal{L}_{\text{rec}}:余弦距离重建损失,强制 proj(h)proj(h) 逼近 f(x)f(x),λ\lambda 设为 0.5。

由于需要计算投影并进行第二轮解码,训练成本增加一倍。但推理时是逐个生成 token,成本与本来的自回归解码并无额外增加。

训练采用课程学习策略:逐步增加操作数位数(先 3 位以内,再扩展到 5 位,最后到 7 位),每阶段保留部分较短数字的样本以稳定学习。所有实验基于 GPT-2 架构从零训练,使用基于数字级(digit-level)的分词器,这已被 Yang 等人证明对数值任务更有利(论文第 2.3 节)。

创新点和贡献

这项工作在三个层面做出了贡献。

一是提出了一种值感知的数值表示机制。与多数改进推理流程或添加文本标注的既有工作不同,该方法直接在嵌入层编码数值量值,使数字被模型以连续信号的形式感知,而非仅依赖 token 的共现统计。这回应了 Yang 等人指出的语言模型缺乏数字量值概念这一根本缺陷。

二是训练-推理一致性设计。通过两轮前向传播分别使用真实嵌入和投影嵌入,并用重建损失对齐两者,该方法解决了多数条件嵌入方案面临的 “训练时可用标签、推理时只能靠预测” 的典型不匹配问题。这种双通路设计对类似的条件信号注入任务具有方法论参考价值。

三是轻量级架构兼容性。方案仅增加嵌入模块和投影模块,不改变 Transformer 主体结构,可与任意仅解码器架构、现有分词器兼容,且推理时无须额外计算步骤或外部工具调用,这与需要大量推理 token 的链式思考方法形成互补。

实验结果分析

实验基于 NUPA 基准(专为隔离数值处理能力而设计),覆盖整数、浮点、分数和科学计数法四类表示,涉及算术运算、比较、计数和格式转换任务,操作数限制在 7 位以内。

主要发现如下:

整体性能(表 1):NumValue-RNN 和 NumValue-MLP 的 Exact Match 分别为 0.724 和 0.720,标准 Transformer 基线为 0.687。Digit Match 和长度偏差(d-Length)指标上同样表现更优。基线对比中,Numerologic 的 Exact Match 仅为 0.633,甚至低于标准 Transformer,论文分析认为 Numerologic 虽提示了数值量级,但仍将其作为离散 token 处理,未能解决数值值编码这个根本问题。

按数字位数分层(表 2):所提方法在各个位数上均一致性优于标准 Transformer,且优势在超过 5 位的较长数字上仍然保持。第 7 位上,NumValue-RNN 为 0.642,基线为 0.613,绝对值提升接近 3 个百分点。

MLP 与 RNN 变体对比:RNN 变体 Exact Match 稍高(0.724 对 0.720),MLP 变体在 Digit Match 和 d-Length 上略优。论文建议将 RNN 作为默认选择,理由是其更强的主指标表现、不受固定长度限制的灵活性,以及更贴近人类处理数字序列的认知方式。但论文未声称统计显著性检验。

按任务组别(附录表 6):在加法、减法、真除法等任务上提升尤其明显;乘法任务上 Numerologic 意外达到 0.545,高于所提方法(0.340/0.367),但论文未就此给出解释。计数和长度统计任务上所有方法均已接近满分。

实践建议

该方法对希望在语言模型中提升数值可靠性的工程团队有以下实践启示:

1. 显式编码优于隐式学习:不要寄望模型从 token 共现中学会数值关系,应在输入端注入量信息。该原则可推广到其他有天然数值或有序结构的领域(如时间、坐标)。

2. 直接采用 RNN 变体:论文建议 RNN 嵌入作为默认配置,它天然适应变长数字,不依赖固定最大长度硬编码。GRU 开销小,工程实现成本可控。

3. 注意训练-推理对齐:类似的条件嵌入方案普遍面临标签可用性不一致的问题。这里使用的双前传加重建损失的策略可直接复用,训练成本翻倍但在推理时零开销,属于可接受的权衡。

4. 数字级分词器是有效基础:论文延续了 Yang 等人的结论(见第 2.3 节),采用 digit-level tokenizer 构建实验。实践中应先确认分词器对数字的处理方式,必要时切换为逐位拆分后再叠加值感知编码。

5. 课程学习稳定化训练:论文采用位数渐进式课程,这对于数值大小跨度大的场景是推荐做法,尤其在资源有限、仅从零训练小模型时。