嵌入模型以奇特的方式进行测量
Embedding Models Measure in Peculiar Ways
论文信息
标题: Embedding Models Measure in Peculiar Ways
作者: Juri Opitz, Andrianos Michail
发布日期: 2026-09-17
arXiv ID: 2609.20821v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:本文考察通用文本嵌入模型是否能把 “1 米”“100 厘米” 这类物理测量表达映射为符合真实物理等价与距离关系的语义空间。
- 核心方法:对 24 个主流嵌入模型,计算物理测量短语对之间的余弦相似度,并与真实物理距离比较;另外设计 PhysScore 基准、线性探针校准实验和表面相似性关联分析。
- 关键结果:所有模型与物理测量距离的对齐都较弱,最佳模型 multilingual-e5-large-instruct 的 Kendall’s 只有 53.23(表 1),全体平均仅 37.59;相似度更偏向字符串表面形式而非数值语义。
- 主要局限:评测集中在物理测量表达这一狭窄领域,不能外推到全部语义能力;校准实验只测试了线性探针;尽管覆盖 24 个模型,仍非全量。
- 适合读者:研究嵌入模型、语义相似度、数值理解,或需要在检索、RAG、问答系统中处理物理量与数值的工程师和研究者。
论文背景和研究动机
嵌入模型通常被当作语义度量空间使用,例如语义文本相似性(STS)任务要求判断两段文本 “在多大程度上语义等价”。但语义相似度本身包含多个维度,难以获得唯一的客观标准。物理测量系统则不同:它们提供客观、可验证的等价关系和距离关系,例如 “1 meter” 与 “100 centimeters” 严格相等,“1 meter” 与 “105 centimeters” 的距离一定小于与 “15 kilometers” 的距离。因此,论文选择物理测量作为理想化测试床,追问一个核心问题:嵌入度量空间与物理度量空间的对齐程度如何。
作者提出这一问题的现实背景是:嵌入模型从 SBERT、SimCSE 到基于 LLM 解码器的新一代模型,训练目标都是让相似文本距离近、不相似文本距离远。但是否因此能表达物理量和数值的深层语义,尚未被系统性检验。论文强调,如果连基础的数量等价(2 公里与 2000 米)都无法识别,那么 “语义相似度” 的说法在涉及测量的场景中就很值得怀疑。
核心方法和技术细节
论文将物理测量表达映射为文本,例如 “10 kilometers”“1 meter”,然后用嵌入模型编码,计算两段文本的余弦相似度。实验选择了 24 个嵌入模型,覆盖 Sentence-Transformers 基线、对比式 BERT 编码器、ModernBERT 编码器以及基于 LLM 解码器的模型,维度从 384 到 4096 不等。
物理量包括长度(米)、质量(千克)、体积(升)、时间(秒)。测量范围分为 Local(0 到 10)、Medium(0 到 1000)、Log(最高 10 万)、Sign(-100 到 100)和 Scientific(科学计数法)。另外还比较数值表达与文字表达(如 “5 meters” 与 “five meters”)。
评测分为几个层次。首先进行可视化探索,画出所有数值对之间的相似度热力图。然后测试单位转换理解,例如 “1 meter” 与 “100 centimeters”“1000 millimeters”“0.001 kilometers” 的相似度是否接近 1.0。接着构建小型基准 PhysScore,使用 Kendall’s 和 Pairwise Accuracy(PAC)两个指标:给定一个参考短语,若其与数值更接近的表达相似度更高,则记一分。最后进行两项分析:一是用线性探针重新校准相似度,看是否只是因为余弦相似度没有强调正确维度;二是计算嵌入相似度与字符级 Levenshtein 距离、tokenizer 级 Levenshtein 距离、真实数值距离之间的 Kendall’s ,以检验表面形式的影响。
创新点和贡献
论文的主要贡献是系统性地揭示通用嵌入模型在物理测量这种客观语义关系上的弱对齐,给出了三条一般化发现。
第一,所有 24 个模型的物理单位和测量表示都一致地弱,出现各种奇怪的对齐模式,例如 “棋盘格” 图案:在 Local 尺度下,2.5 与 7.5 可能比 2.5 与 3 更相似,这违反物理距离。第二,模型强弱、发布早晚、模型家族或嵌入维度并没有带来明显改善;在表 1 中,Qwen3-Embedding-8B 的 Kendall’s 反而低于 0.6B 版本。第三,相似度更多关联字符串表面形式而非数值语义,且线性校准不能实质修正对齐。
相较于以往对数字理解的局部测试,本文把物理测量当作一个严格、可解释的微型语义探针,提供了新的评测视角和公开代码。作者推测,对比学习目标可能没有对数量关系施加足够压力,导致此类对齐难以自然涌现。
实验结果分析
可视化实验(图 2)显示,与理想中光滑递减的相似度图谱相比,两个示例模型 all-mpnet-base-v2 和 Qwen3-Embedding-0.6B 都出现明显非单调伪影。作者特别指出 Qwen3 在 “nine liters” 与所有数字表达、甚至自身文字表达的相似度都异常低。
单位转换实验(图 3)显示,理想情况应接近 1.0 的水平线,但实际曲线弥散。两个示例模型中,Qwen3 的转换相似度总体上稍高,而 mpnet 在数值增大时下降明显。然而没有任何一条线始终接近 1.0,单位转换同样非常模糊。
PhysScore 结果(表 1)给出所有模型的整体排名:最佳为 multilingual-e5-large-instruct,Kendall’s ;全部 24 个模型的平均为 37.59。这意味着没有一个模型能可靠区分物理上更近和更远的测量对。作者特别提醒,这个结果已属乐观,因为对角线上的相同字符串会天然获得高相似度。
细分结果(表 2)表明,质量(kilogram)最难建模,平均 只有 34.54,最低甚至出现负值;长度和时间相对较好。Medium 尺度整体最困难。
校准实验(表 3)中,线性探针带来的变化总体不大,最大提升是 e5-large-v2 的 +12.33,但其绝对 仍只有约 48。所有模型在校准后仍未超过 54。因此论文推断,对齐问题不只是相似度函数失准。
表面相似性分析(表 4)显示,嵌入相似度与字符级或 tokenizer 级相似度的相关性通常明显高于与真实数值距离的相关性。例如 embeddinggemma-300m 的字符级相似度关联为 51.6,而数值距离关联仅为 3.3。作者推测,这解释了为何嵌入主要把物理测量当作词汇对象而非具有大小和顺序的量。
实践建议
本文对涉及数值、单位或物理量的嵌入应用具有直接参考价值。首先,在构建以检索或聚类为主的系统时,不应默认通用嵌入模型能理解数量等价和距离关系。例如,若用户查询 “2 kilometers”,文档中写 “2000 meters”,通用嵌入可能不会给出稳定高分。因此,在索引和查询两端都应先对数值和单位做标准化,将 “2000 meters” 规范为 “2 kilometers” 或统一到基本单位。
其次,在 RAG、智能问答或 Agent 系统中,如果查询涉及物理量比较、范围筛选或单位换算,建议把数值解析与语义检索分离:先由规则或符号模块提取、规范化数值,再用嵌入处理其余自然语言。这样可避免嵌入模型对 “9” 和 “nine” 这种表面形式不一致或对浮点/整数形式过于敏感的问题。
第三,对嵌入模型的选型不能只看综合基准分数。本文在 24 个模型中未观察到规模或发布时间与物理对齐之间的正相关,甚至某些更大模型表现更差。因此,在需要数量语义的任务中,应加入专门的物理测量或数值探针测试,而不是依赖 MTEB 类综合分数。
最后,若必须用嵌入直接做相似度排序,可考虑对数值做显式编码或后处理,例如把数值转换为字符归一化后的科学计数法,减少字符串表面差异的干扰。本文的实验虽然基于当前模型,但揭示的机制——表面形式优先于数量语义——值得作为部署前风险核查的一部分。