F2LLM-v2:面向多语言世界的包容性、高性能与高效嵌入
F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World
论文信息
标题: F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World
作者: Ziyin Zhang, Zihan Liao, Hang Yu, et al.
发布日期: 2026-03-19
arXiv ID: 2603.19223v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:当前多语言文本嵌入模型普遍存在英语中心偏见、训练过程不透明,且缺乏针对不同计算资源的高效模型家族,导致大量中低资源语言和资源受限场景被忽视。
- 核心方法:基于公开数据构建覆盖 282 种自然语言和 40 多种编程语言的 60M 高质量数据集,采用两阶段训练、Matryoshka 表征学习、模型剪枝与知识蒸馏,一次性发布 8 个从 80M 到 14B 参数的稠密 Transformer 嵌入模型。
- 关键结果:F2LLM-v2-14B 在 11 个 MTEB 多语言基准上取得 SOTA(见论文第 4.1 节),同时最小 80M 模型也能在波兰语等低关注度基准上补全空白,显著超越同尺寸前任。
- 主要局限:模型训练依赖公开数据集,未针对某些无专门 MTEB 基准的语言(如西班牙语、阿拉伯语)进行专门评估;剪枝后小模型仍需知识蒸馏才能恢复性能,过程对校准数据和蒸馏策略有一定依赖。
- 适合读者:从事多语言信息检索、RAG、模型压缩及开放嵌入模型研究的工程师与学者,尤其关注资源公平性与训练透明度的从业者。
论文背景和研究动机
文本嵌入模型是将非结构化文本转化为稠密向量的基础工具,在语义搜索、检索增强生成(RAG)、文本分类与聚类等应用中扮演核心角色。近年来,嵌入模型从以 BERT、RoBERTa、XLM-R 为代表的编码器架构全面转向解码器型大语言模型(LLM)嵌入,得益于大规模预训练中积累的强大推理与多语言能力,性能得到大幅提升(如 Qwen3-Embedding、NV-Embed 等)。
然而,前沿研究暴露两个突出问题。第一,英语中心偏见在训练数据和基准评测中日益严重。尽管 MTEB 已成为标准测试集,并扩展至超过 250 种语言,但其子任务仍高度集中于英语和中文等高资源语言,许多中低资源语言(如波兰语、孟加拉语)对应的 MTEB 排行榜几乎没有模型提交完整结果(论文图 1 显示波兰语仅有 1 个模型有完整结果)。不少多语言模型仅在多语言综合榜上占优,在各语种专有基准上表现不佳。第二,透明度鸿沟显著。当前顶级嵌入模型(如 Gemini-Embedding、Qwen3-Embedding)要么通过闭源 API 发布,要么仅公开权重而不披露训练数据和方法,严重阻碍复现研究,也无法验证其对低资源语言的真实覆盖。
正是在这一背景下,论文提出 F2LLM-v2 模型家族,意图同时解决语言包容性和计算包容性两大痛点,并以完全开源的方式推动嵌入研究的透明化。其核心目标并非仅仅在现有英语或多语言总榜上刷分,而是构建一套在真实世界多语言环境下均能高效工作的嵌入工具。
核心方法和技术细节
F2LLM-v2 的核心架构围绕四条设计主线展开:全公开高多样性数据、多尺寸模型体系、两阶段训练策略与剪枝‑蒸馏协同优化。
训练数据聚合 研究团队从 157 个公开数据源中精选出 6000 万高质量训练样本,涵盖 282 种自然语言(基于 ISO‑639‑3 编码标识)和超过 40 种编程语言。与 KaLM‑Embedding 等同类工作不同,该数据分布不刻意向高资源或基准语种倾斜,而是尊重真实互联网数据的自然频率。语种分布(图 2)显示西班牙语、阿拉伯语、意大利语、印尼语、葡萄牙语等虽缺乏 MTEB 专项基准,依然占有可观的训练比例;低资源语言形成长尾覆盖。任务类型则包含检索式问答、翻译对挖掘、情感分析、意图/领域分类等(图 4),统一转化为检索、聚类、二分类三种规范格式训练,充分利用对比学习的统一损失函数。对于检索式数据,采用查询‑正文档‑困难负样本三元组,同时引入批次内负样本和由 Qwen3‑Embedding‑8B 挖掘的显式困难负样本;聚类和二分类仅用困难负样本,避免批次内负样本可能引入的假阴性。
模型规模与剪枝 模型家族包含 80M、160M、330M、0.6B、1.7B、4B、8B、14B 共 8 个尺寸,全部基于 Qwen3 的稠密 Transformer 解码器架构,取序列结束符(EOS)的最后一层隐藏状态作为嵌入表征。为得到三个小型模型,论文在完成第一阶段训练后,将 0.6B 模型沿隐藏维度、MLP 中间维度和层维度剪枝:根据小规模校准集上的激活范数对行和列的权重进行裁剪;层剪枝则直接保留前 层。直接训练剪枝模型会造成大幅性能退降(见消融研究,论文未列出具体数值,但指出 “大型性能下降”),为此引入基于均方误差的知识蒸馏损失,强迫学生模型的序列嵌入与教师模型(在原文中对应 0.6B→80M 等路径教师分别为 0.6B 或更大模型)输出一致。蒸馏不仅用于剪枝模型复苏,也被进一步应用到 0.6B 和 1.7B 的第二阶段训练中,提升其表现。
两阶段训练与 Matryoshka 学习 第一阶段专注于建立多语言的语义基础,仅使用 7 个大规模检索数据集(总计 2700 万样本),无指令前缀,学习通用的粗粒度语义匹配。第二阶段调入 1800 万混合任务数据,涵盖分类、重排序、释义检测等,对查询施加任务特定指令,并对 30% 的对称任务中的文档和负样本也随机加指令,以此增强模型对任务语境的敏感性。两个阶段均应用 Matryoshka 表征学习(最小维度为 8),使得单一模型能够按需输出不同长度的向量,平衡精度与存储开销。
创新点和贡献
F2LLM-v2 的创新并非单项技术突破,而是在系统工程和开源哲学上实现多重贡献。
-
语言包容性驱动的数据策略:相对于主流数据集强烈偏向英语和中文,该工作大幅提升众多缺乏评测的中资源语言和编程语言的配比,并保持低资源语言的长尾,从根源上缓解此前嵌入模型在非主流语言上的能力缺失。数据收集原则强调 “真实可得性” 而非基准优化,为多语言嵌入研究提供了新思路。
-
完整的模型效率谱系:通过剪枝与蒸馏联合训练,在同一架构内同时产出从端侧到云端的 8 种尺寸模型,且均保持竞争力。这种同时在参数规模、推理效率和存储成本上做深度的做法,使 F2LLM-v2 系列能够同时服务资源受限的边缘设备和高吞吐中心化服务,为嵌入模型部署提供统一方案。
-
彻底的开源透明性:F2LLM-v2 不仅开源全部模型权重,还连同训练数据、代码、中间检查点一并释出,打破了当前顶级嵌入模型普遍黑箱或半透明的格局。这一做法极大方便了社区的复现、改进和针对特定语言的继续微调。
-
细粒度多语言评测:评测不仅关注综合多语言榜,更重点展示在 11 个语种专有 MTEB 基准上的 SOTA 结果(如论文图 1 所示)。特别是在波兰语这类几乎被遗忘的基准上,F2LLM-v2 首次提交完整结果并建立新基线,实际展现了语言包容性的落地效果。
实验结果分析
论文在多个 MTEB 基准上对全家族进行了对比评估。14B 模型一举在 11 个语言特定榜上夺得第一名,超越了此前分别由 Gemini‑Embedding、Qwen3‑Embedding 等保持的记录。以图 1 为例,各项语种榜横线代表的先前 SOTA 被显著超越,且较小模型同样能在各自量级达到顶尖水平。例如,0.6B 模型在多种语言上超过了同等尺寸甚至更大规模的前任模型(具体数字见论文主结果部分)。这一结果充分证明了数据多样性和训练策略对多语言能力的提升,而不仅依赖于简单扩大模型容量。
剪枝与蒸馏的消融实验(论文未列详细表格,但参考文献中的实验说明)证实:没有知识蒸馏的剪枝训练导致性能大幅下滑,而通过 MSE 蒸馏可以恢复到接近未剪枝的水平,验证了该范式在嵌入模型压缩中的有效性。值得注意的是,蒸馏甚至对 0.6B 和 1.7B 等非剪枝模型也有正向作用,表明教师‑学生范式可以作为一种通用的增强手段。
此外,Matryoshka 训练使得模型在极低维度(如 8 维)下仍能保留关键语义信息,为用户提供了灵活的存储-精度权衡,这在向量数据库应用中有极高的工程价值。
实践建议
基于 F2LLM-v2 的设计特点和公开资源,工程团队可在以下场景中直接受益。
多语言 RAG 系统构建 若业务涉及阿拉伯语、印尼语、波兰语等缺乏专项嵌入模型的语种,可直接采用 F2LLM-v2 系列,它将带来远优于英文中心模型的检索精度。建议在第二阶段推理时为查询添加任务相关指令(如 “搜索与查询相关的文档”),以激活模型的任务意识。对于对称任务如释义检测,可对两侧文本均随机加入指令,略微增加计算量换取边界性能提升。
资源分层部署 利用模型家族和 Matryoshka 表示,可在不同环境灵活切换:云端使用 14B 模型并存储 768 或 1024 维完整向量以保证最高精度;靠近边缘的服务器可采用 1.7B 或 0.6B 模型,配合 256 维向量显著降低内存和 I/O 开销;移动端或网页内嵌搜索可直接部署 80M 剪枝模型,使用 8 或 16 维向量做粗筛。由于所有模型共享统一的 EOS 嵌入格式和训练目标,向量空间高度兼容,便于梯度式查询架构。
代码和多语言混合场景 F2LLM-v2 包含大量编程语言数据,适合作为代码搜索引擎的文本侧编码器。在技术文档问答或其他代码‑自然语言混合语料中,可直接使用该模型进行零样本检索,或基于公司内部的语种配比进行少量微调。公开的训练代码和中间检查点将大幅降低微调成本。
低资源语言微调 出于对中低资源语言的特别强化,F2LLM-v2 可作为优秀的起始点,用于针对缺乏标记数据的小语种进行持续对比学习或分类嵌入微调。在实践中,只需收集少量对应语种的查询‑文档对,以冻结或低学习率微调即可快速迁移,而无需重新训练整个嵌入空间。
工程团队应关注数据许可和模型的使用限制,遵循论文附带的开放许可协议。同时,虽然模型在诸多语言上表现优越,但仍应结合目标场景的实际查询分布进行小规模 A/B 测试,以验证向量召回率和精度是否满足业务需求。