DARE-bench:评估数据科学中大语言模型的建模与指令保真度

DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science

arXiv: 2602.24288v1

论文信息

标题: DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science

作者: Fan Shu, Yite Wang, Ruofan Wu, et al.

发布日期: 2026-02-27

arXiv ID: 2602.24288v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现有数据科学 LLM 基准要么缺乏过程忠实度评估,要么缺少大规模可训练的标注数据,无法同时衡量模型对指令的遵循程度和建模能力。
  • 核心方法:构建 DARE‑bench —— 一个包含 6300 个 Kaggle 衍生任务的双角色基准,既通过可复现的参考代码衡量指令遵循(IF),又通过原始真实值评估 ML 建模(MM)和时序预测。
  • 关键结果:用 DARE‑bench 训练数据进行监督微调或强化学习,可使开源模型性能大幅跃升——Qwen3‑32B 总分提升 1.83 倍,Qwen3‑4B 则提升超过 8 倍(见论文表 6)。
  • 主要局限:任务只覆盖表格数据,不涉及多模态输入;生成大量可执行轨迹的成本高;拒绝采样策略可能引入对短轨迹的偏好(见论文附录 C)。
  • 适合读者:从事数据科学 agent、LLM 评估基准、强化学习与微调对齐,以及希望用可验证奖励训练模型的工程师和研究者。

论文背景和研究动机

大型语言模型正被越来越多地用作数据科学代理,通过工具增强的代码执行来完成数据读取、变换和建模等一系列多步骤工作流。然而,对这种复杂工作流进行严格评估的基准还远远不够。现有基准大多只关注最终答案的准确性,却几乎不衡量过程忠实度和可复现性(见论文第 1 节)。同时,很多工作侧重提示工程和工作流设计来提升模型性能,而缺少直接通过高质量训练数据来培养 LLM 领域技能的系统方案。

构建一个既能评估过程忠实度又能支撑模型训练的基准面临两大挑战。其一,专家级、可执行的数据科学过程轨迹极为稀缺且昂贵。当前基准大量依赖人工处理和 Kaggle 竞赛,形成严重的数据瓶颈。其二,评估 “过程忠实度” 非常困难,随机性和环境效应会混淆行为,验证代理是否遵循了允许的数据科学实践需要受控的仪器化平台。这些挑战限制了现有基准的数据质量和评估范围,错失了释放模型全部潜力的机会。

为此,论文提出了 DARE‑bench(Datascience Agentic REasoning bench),一个训练导向的数据科学代理基准。它利用两类可验证任务——过程感知的指令遵循任务(通过执行严格遵循指令的参考代码得到确定性的参考输出)和 ML 建模任务(直接与数据集原始真实值比较)——实现了对指令遵循和建模性能的自动化、客观评测。同时,DARE‑bench 提供了大规模训练数据,可同时作为评估基准和微调资源。

核心方法和技术细节

DARE‑bench 包含三类数据科学任务族:分类、回归和时间序列预测,每族又分为两个变体,分别探测不同的代理能力。在分类和回归中,IF 变体要求模型严格复现参考工作流,所有预处理步骤、模型选择和参数都必须与给定指令一致,最终预测与参考预测完全匹配才算正确;MM 变体则只关注最终预测与真实标签之间的指标(宏 F1 或裁剪 R²),给予模型完全自由。时间序列预测的 XF 变体保留所有外生特征,而 CF 变体在测试时仅提供时间戳和实体标识,更接近经典预测设置。

论文设计了一条完全自动化的数据策展管线,分为四个阶段(见论文图 2):

  1. 数据源采集:从 Kaggle 按标签、许可证和大小筛选表格数据集,并利用轻量级网页爬虫获取额外的自然语言描述作为增强的元数据。
  2. LLM 辅助任务设计:使用 LLM 评估数据集是否适合构造有意义的预测任务,同时识别目标列、特征列及数据类型,并检测时序特性。
  3. 后处理:对分类/回归数据,执行随机训练/测试拆分,并为 IF 任务在约 20% 训练数据中注入受控噪声(超出有效范围的数值、意外类别等);对时序数据,按时间顺序拆分,并自动重采样不规则时间序列。
  4. 最终化:在沙箱中验证 IF 任务的参考代码可以完全复现并生成确定性的预测,然后封装为标准化任务包。

评估全部基于可验证的真值:IF 任务比较模型预测 y^\hat{\mathbf{y}} 与参考输出 yref\mathbf{y}_{\text{ref}} 是否完全匹配;MM 和时序任务则直接用 y^\hat{\mathbf{y}} 与真实值 ygt\mathbf{y}_{\text{gt}} 计算宏 F1 或裁剪 R2R^2。这种设计完全摆脱了人类或模型评判,使得评价指标与任务表现直接挂钩,适合用于监督微调(SFT)和基于可验证奖励的强化学习(RLVR)。

创新点和贡献

DARE‑bench 的主要创新体现在以下几个方面:

  • 同时评估指令遵循与 ML 建模:大多数现有基准要么只检查最终预测的准确性,要么仅关注代码正确性。DARE‑bench 的 IF 任务通过可复现的参考代码提供了对过程忠实度的严格检验,而 MM 任务则模拟了用户只关心模型精度的实际场景。两者结合能够更全面地刻画数据科学代理的能力。
  • 全自动、可扩展且可验证:策管流程大幅减少了对人工标注的依赖,使构建 6300 个大规模任务成为可能。所有任务都有可验证的真值,既保证了评估的客观性和可复现性,也为基于奖励的强化学习提供了可靠信号。
  • 兼作训练资源:论文明确将 DARE‑bench 定位为训练导向基准,并通过 SFT 和 RL 实验证明,直接在其训练任务上微调能够显著提升模型在基准上的表现,并且这种提升还泛化到了外部基准 DSBench 上(见论文表 8)。
  • 覆盖真实数据挑战:数据来自多个领域,自带类别不平衡、缺失值、噪声和时间不规则性等现实问题,同时施加了 200 秒运行时间和最多 5 轮交互的约束(见论文第 4.2 节),模拟了真实用户对效率和准确性的要求。

实验结果分析

论文首先对 gpt‑o4‑mini 进行了超参数敏感性分析,发现交互轮次对性能影响显著:从 3 轮增加到 5 轮,分类‑IF 准确率从 37.16 跃升至 67.56(见表 4)。最终选择 (5 轮,200 秒) 作为标准配置。

在此配置下,对 8 个主流 LLM 进行了全面评估(见表 5):

  • Claude‑Sonnet‑3.7 在六项指标中的四项(分类‑IF、分类‑MM、回归‑MM、时序‑XF 和时序‑CF)取得最高分,展现出最强的整体能力。
  • gpt‑5 在两类指令遵循任务上领跑,而 gpt‑4.1 和 gpt‑o4‑mini 紧随其后。
  • Claude‑Sonnet‑4 表现极差,几乎在所有类别垫底,原因在于它倾向于将任务分解为过细的子步骤,几乎总是超出轮数限制而提前失败。
  • 开源模型 Qwen3‑32B 和 Qwen3‑4B 远远落后,在前五项指标上的得分均不足 37,且时序‑CF 任务全部得 0 分。

错误分析显示(见论文图 3 和表 9),专有模型的失败主要归于代码错误和指令不遵循,而开源模型则频繁超出执行时间限制。在指令遵循任务中,模型常常忽略固定的随机种子、混淆列名、跳过关键预处理步骤;在 ML 建模任务中,则出现硬编码元数据、粗暴标签编码和 NaN 处理不当等脆性推理。

论文的核心实验在于微调。利用拒绝采样从多条轨迹中筛选有效且多样化的轨迹,采用不同策略(FV、AV、BV、DV)对 Qwen3‑32B 进行 SFT。结果显示(见表 6):

  • SFT‑AV 和 SFT‑DV 策略将总分从基线 23.25 提升至约 42.83,提升幅度接近 1 倍,同时在 “仅考虑成功尝试” 的 Model‑Perf 指标上也提升了 5~7 个百分点,说明微调不仅增强了遵循指令的能力,也真正提高了数据科学建模质量。
  • 对 Qwen3‑4B 使用 GRPO 进行强化学习(不进行组归一化),将总分从 4.39 提升至 37.40(超过 8 倍),Model‑Perf 从 54.18 提升至 62.55,并且代码错误和执行超限错误均大幅下降。

消融实验(表 7)进一步证明,仅用 IF 数据训练会损害预测建模性能,仅用 MM 数据训练则损害指令遵循能力,只有两者结合才能取得稳健的平衡。外部验证在 DSBench 的建模任务上(表 8)也显示,经过 DARE‑bench 微调的模型相对基线有绝对 5~10 个百分点的提升,证实训练收益能够泛化。

实践建议

DARE‑bench 的构建方式和实验结果给出了几条对实践者有益的启示:

  1. 将基准作为训练数据池加以利用 如果希望提升 LLM 在多步骤数据科学任务上的表现,不要止步于评估。直接使用 DARE‑bench 中的训练任务进行监督微调,或者采用类似 GRPO 的强化学习方案搭配可验证奖励,能够有效减少代码错误和过程偏差。论文表明,即使是较小的 Qwen3‑4B,通过 RL 也能获得与未微调大模型相当甚至更好的表现。

  2. 组合使用过程导向和结果导向的任务 在构造自己的对齐数据时,应同时包含严格指令遵循和开放建模两类任务。前者能教会模型精确执行预设流程,培养工具使用纪律;后者则保留建模自由度,锻炼模型的探索和取舍能力。仅训练单一类型会带来能力退化。

  3. 关注交互轮次与执行时间的平衡 论文的敏感性分析清楚地表明,一味增加轮次或执行时间收益递减,而 5 轮、200 秒的设置已经能释放大部分潜力。在工程落地时,可根据延迟预算选择相应配置,避免无限等待的同时获得足够好的结果。

  4. 利用确定性环境实现可复现代理评估 DARE‑bench 通过控制随机种子、固定环境和提供参考代码,使过程忠实度评估自动化、可量化。在自己构建数据科学 agent 的评估流程时,应优先设计可复现的参考工作流,这样不仅能减少人工评判成本,还能为后续 RL 提供准确的奖励信号。

  5. 关注模型的时间序列能力短板 所有模型在时序‑CF 任务上的得分都极低,表明当前 LLM 在纯预测建模(仅依赖历史观测)方面存在严重不足。实际系统中,应谨慎将 LLM 作为时序预测的主体,可考虑将其用于特征工程或模型选择辅助,而将最终预测委托给经典统计或深度学习模型。