从价值观到基准:评估荷兰政府用途的大型语言模型
From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch
论文信息
标题: From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch
作者: Laurens Samson, Iva Gornishka, Gossa Lô, et al.
发布日期: 2026-08-10
arXiv ID: 2608.09925v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:论文试图解决在荷兰政府部署大语言模型时,缺乏同时兼顾公共行政价值观与非英语语言要求的系统性评估框架这一问题。
- 核心方法:通过与阿姆斯特丹市的领域专家组成咨询委员会,结合用户研究与问卷调查,将可持续性、社会偏见、事实性、诚实性、成本、训练数据透明度六项价值观转化为可量化的基准测试维度,并对 30 余个多语言及荷兰语专有模型进行统一评测。
- 关键结果:没有任何单一模型在所有维度上同时表现最优;在本次评测覆盖的模型中,更高质量通常伴随更高的能耗与财务成本,而偏见几乎独立于质量与成本(图 3)。
- 主要局限:事实性基准主要来自英语测试集的翻译,可能因翻译偏差而影响评估准确性;偏见维度仅覆盖部分受保护特征,且基准分数与实际部署中的公平性行为之间的关系尚不明确。
- 适合读者:负责为政府或公共部门筛选、部署大语言模型的工程师、产品负责人、政策制定者,以及对负责任 AI 评估感兴趣的研究者。
论文背景和研究动机
大语言模型正在快速进入公共服务领域,从撰写公民回函到辅助内部文档处理。然而,政府自身既是 AI 伦理的监管者,又是 AI 的使用者,这一双重角色使其在部署时必须仔细权衡风险。过往案例——如荷兰的 SyRI 福利欺诈检测系统因不透明算法被判侵犯隐私,加拿大的移民评估工具引发问责争议——说明缺少严格评估的 AI 系统可能造成实质性社会伤害。
现有评测体系难以满足政府的独特需求。绝大多数基准以英语开发,非英语语言上的性能无法可靠迁移。即便存在部分荷兰语基准,它们也彼此独立,未统一在一个框架内,且多面向技术用户,政策制定者难以读懂原始分数。例如,一个 88% 的 MMLU 分数对公务员而言,几乎无法判断它是否意味着该模型已足够可靠。
为填补这一缺口,论文直接与阿姆斯特丹市政府合作,通过参与式方法识别出公共行政人员最关心的价值观,再构建能度量这些价值观的评测套件,最终输出一个面向非技术用户的交互式模型概览。研究同时覆盖了通用多语言模型(如 GPT、Mistral、Qwen 等)和荷兰语专有模型(如 GEITje、Fietje),以反映真实的选型需求。
核心方法和技术细节
从组织价值观到可测维度
论文的价值识别过程分三步完成:
- 初期问卷:咨询委员会成员对 10 个预定义价值进行评分,并自由写出关注点。包容性和事实性获得最高平均分,成本与荷兰文化知识得分较低(图 2)。
- 深度讨论:基于问卷结果进行结构化会话。讨论中,成员区分了 “事实性” 与 “诚实性”:模型答对所问固然重要,但面对不知道的问题时坦然承认也不可或缺。因此诚实性被单独剥离为一个维度。
- 持续反馈:委员会后续还定期复审中期成果、细化维度的具体定义,确保框架始终贴合最初的价值观。
此外,18 名从业者访谈表明,现有排行榜对非技术用户极不友好,原始分数难以解释,容易诱导人们只选最高分的模型而忽视其他重要维度。一次面向 429 名内部聊天机器人用户的调查则显示,最终用户最看重质量与事实性,对可持续和包容性关注较低。
六个评测维度及其操作化
- 可持续性:使用 CodeCarbon 测量每次推理的能耗(单位:kWh / 1k 提示),为避免因区域碳强度差异带来的偏差,只报告能耗而非碳排放。闭源 API 模型因基础设施透明度过低,能耗数据缺失。
- 社会偏见:通过两个荷兰语基准衡量。Dutch BBQ 测试模糊情境中的刻板推理,BZK Social Bias 在模拟招聘场景中检测性别和出生地偏见。最终报告四个受保护特征(年龄、残障、性别、出生地)的独立得分。
- 事实性:采用机器翻译的 MMLU、ARC-Challenge 和 TruthfulQA 的 TinyBenchmarks 子集,每个基准 100 个样本,用 GP-IRT 估计方法提升估计可靠性,再将三项平均分映射为 1–5 级定性等级。
- 诚实性:论文专门构建了 HonestCityBench,包含 530 条荷兰语提示,覆盖过时信息、错误前提、信息不足等五类限制情境。使用三模型判官集成评估,相比人类标注取得高相关性。诚实分数按正确承认局限的比例同样转化为 1–5 级。
- 训练数据透明度:定性地分为开放(完整语料公开)、描述(有足够文档)、封闭(无实质披露)三类,不产生数值分数。
- 成本:对 API 模型按令牌定价估算每千次提示费用;对自托管模型则依据平均响应时间与 GPU 小时费率折算。成本也以绝对值展示。
除此之外,还纳入了文本简化(用阿姆斯特丹市文本和 INT Duidelijke Taal 数据集,度量 SARI)和摘要(用机器翻译的 CNN/DailyMail 与 XSum,度量 BERTScore)两个政府典型用例。
评测设置
所有模型在相同条件下运行:单块 H100 GPU,温度 0,推理模式下 “思考” 功能被抑制到最低。开源模型通过 HuggingFace + vLLM 服务,闭源模型通过阿姆斯特丹市的专用 Azure 部署。为降低评测本身的能耗,各基准样本规模控制在 100–1000 条之间。
创新点和贡献
这项工作有四项主要贡献:
- 以价值观驱动评测设计:不是先定基准再去套政府场景,而是从组织内部的专家协商出发,将抽象的价值概念(如可持续、包容)逐级转化为可操作的基准维度,并保留诚实性这类治理层面尤其重要的细微需求。
- 首个面向荷兰政府的多维度 LLM 评测框架:整合了多个原本独立的荷兰语基准,并补充了 HonestCityBench 等新工具,使政府在评估事实性、偏见、能耗等维度时无需再东拼西凑。
- 大规模实证比较:系统评测了 31 个模型,涵盖从 Mistral 7B 到 GPT-5 的多家供应商,明确揭示出在荷兰语场景下各维度的性能排名与内在权衡(表 1)。
- 非技术友好的公开排行榜:将所有分数转化为颜色、图标和标准化条形图(图 1),证书与政策的决策者也能快速对比模型,避免了原始数值带来的误导。
实验结果分析
维度之间的权衡
表 1 和图 3 清晰地展现了 “最优模型不存在” 的结论。以事实性与成本为例,GPT-4o 和 Mistral Medium 2505 等高质量模型每千次提示费用远高于多数开源模型,而开源模型(如 EuroLLM、Apertus)虽然在透明度和能效上更优,但质量普遍处于中低档。能量消耗也呈现类似规律:质量越高,能耗越大。OLMo 2 32B 甚至在同等质量下因为输出冗长而产生了不成比例的高能耗,说明模型大小并非环境影响的可靠指标。
偏见维度则表现独立。无论成本高低、回答准确与否,偏见得分广泛散布,意味着 “花更多钱买不到低偏见模型”。例如,GPT-5 的事实性最高(0.76),但其性别和出生地偏见得分与一些低成本模型相当;GPT-5 Nano 同时具备较低质量和较高偏见,属于双维度上的不佳选项。
事实性与诚实性的分离
论文中最具警示性的是事实性与诚实性之间的不对称(图 3d)。虽然整体上二者存在弱正相关,但最高能力前沿明显以诚实性为代价去换取事实性。最新一代模型 GPT-5、Mistral Large 3、Mistral Medium 2505 的事实性分别达到 0.76、0.71、0.75,但诚实性只有 0.14、0.21、0.21,远低于前代 GPT-4o(0.43)和 Mistral Small 24B(0.41)。作者推测,近期的对齐工作可能过度追求 “有帮助性”,鼓励模型给出自信回答而非坦承不知。对政府应用而言,自信的错误可能带来比不回答更严重的公民伤害,因此不能仅凭事实性得分就判定模型安全。
荷兰语专有模型的表现
GEITje 7B Ultra 在简化任务上取得了最高 SARI 分数(45.77),但其事实性偏低,仅在 0.39。Fietje 2 的质量与成本处于表 1 的劣势区。这提示通用多语言模型即便未经专门荷兰语训练,也可能在多数维度上比专有模型更有竞争力;若将专有模型用于广泛行政任务,仍需多维度评估。
实践建议
这份成果已经以 Grip on LLMs 交互式网站的形式开放,其设计目标是为政府机构提供可操作的选型工具。对于打算参考或复现此框架的组织,以下几点建议可供参考:
- 把价值观翻译成可测维度时,必须让技术与非技术人员共同参与。论文的咨询委员会机制虽简单,却有效避免了 “堆砌已有基准” 的惯性,并挖掘出 “诚实性” 这类容易被忽略的维度。实践中,可以效仿这套流程,先问卷、再研讨、再持续反馈,将组织自身的政策目标(如碳中和目标、反歧视政策)映射为具体基准。
- 绝不依赖单一指标做决策。论文结果明确显示,质量、能耗、偏见、诚实性彼此没有强正相关,只追求 “最准确” 的模型很可能会选到能耗大、偏见高、又不肯承认无知的系统。应当设定最低可接受阈值,然后在新一轮人机评估中权衡其他维度,而非简单排序后选第一名。
- 将能耗和成本视为一等公民,而非附属品。多数基准只关心准确率,但政府预算和环保承诺同样具有约束力。对于需要自托管的情况,务必在评测时记录真实能耗,而非仅凭零样本成本公式推算。没有真正的能耗数据,就无法做出符合气候目标的采购决策。
- 高度关注诚实性,特别是对公民直接服务的场景。测试中可在内部数据集上添加有意不可答的问题,测量模型的拒答率与臆造率。若模型表现出类似 GPT-5 那样的 “高事实性、极低诚实性”,应格外谨慎,优先考虑在提示工程或检索增强架构中增加限制性指令,强制要求它在不确定时明确告知用户。
- 重视偏见评测的覆盖面和上下文相关性。论文仅覆盖了年龄、残障、性别和出生地四个特征,但阿姆斯特丹市承认 16 个保护理由。实施时可使用论文提及的 Dutch BBQ 和 BZK Social Bias 作为基础,并逐步扩展至国籍、肤色、性取向、宗教等更多维度。然而,基准分数不能直接等同于部署公平性——必须结合实际用例(如福利资格审核或居民投诉处理)开展对抗性测试,才能判断偏见是否会在真实服务中表现出来。
总结而言,“Grip on LLMs” 框架提供了一个可复用的方法论:从价值观出发设计评估,公开全部测试细节与排行榜,以便非技术利益相关者也能做出负责任的模型选择。对于任何计划在公共服务中引入大语言模型的机构,这套流程和开源代码库都能成为降低社会风险的第一道门槛。