译中寻回:基准与数据集自动化翻译的高效流水线
Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets
论文信息
标题: Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets
作者: Hanna Yukhymenko, Anton Alexandrov, Martin Vechev
发布日期: 2026-02-25
arXiv ID: 2602.22207v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:当前多语言大模型评测基准(如 MMLU、Hellaswag)的翻译质量参差不齐,存在语义偏移和上下文丢失,导致模型性能评估失真。论文聚焦于如何高质量、自动化地翻译这些基准。
- 核心方法:提出一套全自动翻译框架,并引入 T-RANK 方法——一种通过多轮竞争排序来筛选和优化译文的测试时计算策略,同时整合了 Universal Self-Improvement(USI)和 Best-of-N 等方法。
- 关键结果:在 Winogrande 基准的 8 种语言翻译中,使用论文方法后,模型评估得分平均提升了 +3.42%(见表 3)。这表明更高质量的翻译能显著影响评估结论。
- 主要局限:方法高度依赖闭源大模型(如 GPT-4o-mini、Gemini),在开源模型上的验证有限;未实现按输入文本难度自适应选择翻译方法,对所有语料采用统一策略。
- 适合读者:从事多语言大模型评估、数据标注管线的工程师,以及对东欧与南欧语言 NLP 任务感兴趣的研究者。
论文背景和研究动机
评估大语言模型在多语言场景下的真实能力,高度依赖高质量的评测基准。然而,论文作者发现,当前主流的多语言基准(如 Global-MMLU、MuBench、Okapi)普遍存在翻译缺陷。常见问题包括:将问题和答案选项分开翻译,割裂了上下文关联;大量使用旧版 GPT-4 或 Google Translate 等传统工具,未能利用前沿大模型的指令遵循能力;以及忽略目标语言的复杂语法特征。
特别是在东欧和南欧语言中,丰富的格系统、语法性别和动词体等特征对翻译的上下文一致性要求极高。例如,在 Winogrande 这类代词消解任务中,若翻译不当,句子中形容词的语法性别会直接泄漏正确答案,使本应考察推理能力的任务退化为简单的语法匹配(见表 6 示例)。因此,论文设定三大研究问题:1)现有翻译基准是否健壮?2)测试时计算扩展能多大程度提升翻译质量?3)如何在翻译中有效融合目标语言独特的语言学特征?
核心方法和技术细节
论文提出了一套模块化的全自动翻译框架,支持数据集和基准两种模式,并集成四种翻译策略,以平衡成本与质量。
- Self-Check(轻量自校):零样本直接翻译,并可选地用另一个评判模型对译文进行复查。论文指出此方法简单,但可能产生虚假纠错。
- Best-of-N(多数采样择优):在高温度系数(0.7)下采样 N 个候选译文,再由大模型按 1-10 分打分,选出最高分。但论文揭示了大模型评分存在位置偏见,倾向于给靠前的候选译文更高分,导致选出的并非最佳译文(见附录 A.1 表 5)。
- Universal Self-Improvement(通用自我提升):不同于 Best-of-N 的单选最优,USI 要求模型融合 N 个候选译文的优点,只调用 次模型即生成一个综合最优版本。该方法在短文本数据集翻译上展现出高性价比。
- T-RANK(翻译排序):这是论文的核心创新。它同样先采样 N 个候选译文,然后引入多轮竞争排名机制——让所有候选译文在每一轮中系统地轮换排列位置,使每个候选都被审视过一次。由于大模型裁判在比较时更容易发现细微错误,此方法大幅缓解了位置偏见,并能捕捉其他方法遗漏的语法或术语瑕疵。最终,排名第一的译文会被再次送入模型进行最后的精炼修正(总调用次数 )(图 2)。
对于任务格式,框架强制要求将问题和所有候选答案打包在同一条提示中进行翻译,从根源上解决上下文割裂导致的语法不一致和答案泄漏问题(见论文表格 6)。
创新点和贡献
- 提出 T-RANK 翻译排序法:相较于 Best-of-N 的绝对打分,T-RANK 通过多轮相对排序迫使裁判模型进行更细致的对比推理,有效识别并修正了隐式错误。论文在附录 A.1 图 3 中的实例显示,T-RANK 能修正 USI 未能发现的词语搭配和格语法错误。
- 揭示并缓解评测中的位置偏见:论文量化了裁判模型对不同排列位置的偏好(如最偏好被排在第 2 位的候选),并通过自动轮换策略显著削弱了这一偏差(附录 A.1 表 5)。
- 开源多语言高质量基准:公开了 MMLU、Hellaswag、ARC、Winogrande 在乌克兰语、罗马尼亚语、保加利亚语等 8 种东/南欧语言的高质量翻译版本,为低中资源语言的模型评测提供了更可靠的基础设施。
实验结果分析
论文从翻译自动指标和下游任务评测两个维度展示了方法的有效性。
在机器翻译自动指标上,论文使用 FLORES 和 WMT24++ 数据集,结合 COMET 参考指标进行评测。结果表明,USI 和 T-RANK 均显著优于基线零样本翻译。一个有趣的发现是,使用多种语言(英文和至少两种目标语言)混合编写不同提示时,多提示采样(multi-prompt)能比单一提示带来额外的质量提升(例如 GPT-4o-mini 在 WMT 英翻乌克兰语任务下,USI 多提示比单提示高 0.006 分,见表 21)。
在基准翻译质量上,作者采用 LLM-as-a-judge(Gemini-2.5-Flash)对比论文翻译与 Global-MMLU 翻译,在乌克兰语、罗马尼亚语和立陶宛语的 MMLU 评测中,论文方法均获压倒性优势(例如在 14042 个乌克兰语测试样本中,胜 8750 次,平 3276 次,仅输 2016 次,见表 2)。
核心证据来自下游模型评测分数。论文使用 Gemma 3、Llama 3.1 等流行模型在论文翻译的基准上运行,与在原版翻译上运行的结果对比。在所有基准和语言上,论文翻译普遍导致了更高的模型得分(见表 3 和 4)。其中,解决答案泄漏的 Winogrande 改进最大,平均提升 +3.42%;受影响较小的 MMLU 也有 +0.94% 的提升。按语言看,希腊语(+3.89%)和乌克兰语(+2.7%)改善最为显著。唯一的例外是专业人工翻译的保加利亚语 Winogrande,其质量仍优于论文的自动翻译方法,说明人工干预在极端复杂情景下仍具价值。
实践建议
如果你正在构建多语言大模型评测系统或数据集,本论文提供了可立刻落地的实践方向:
- 翻译 QA 基准必须绑定上下文:绝对不要将问题和选项分离翻译。将
{"Question": "…", "Answers": ["A", "B", "C", "D"]}整体作为 LLM 的输入,并要求其保留列表结构输出。 - 采用测试时计算策略替代简单重采样:对于资源有限且重视短平快翻译的场景,优先使用 USI,它仅需 次调用即可生成稳健的融合结果。如果使用 Gemini 或 GPT-4o 系列,并且需处理复杂长句或消除细微错误,可启用 T-RANK。建议 保持高性价比。
- 利用多语言提示提升模型对齐:提示不仅限于英文,可混用目标语言与英文来描述翻译任务规范。论文显示,这种做法能约束模型更好地遵循目标语言的语法规范,对提升中低资源语言质量有奇效。
- 重视评测的偏差:在自行实现 Best-of-N 时,务必内部设计位置轮换或成对比较机制,避免直接要求模型打分,以防大模型的 “裁判偏见” 污染最优候选的筛选结果。