FinTradeBench:用于大语言模型的金融推理基准
FinTradeBench: A Financial Reasoning Benchmark for LLMs
论文信息
标题: FinTradeBench: A Financial Reasoning Benchmark for LLMs
作者: Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan, et al.
发布日期: 2026-03-19
arXiv ID: 2603.19225v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决现有金融问答基准只关注公司基本面、忽略市场交易信号的问题,需要构建一个能评估大语言模型在基本面与交易信号联合推理能力的基准。
- 核心方法:提出 FinTradeBench 基准,覆盖纳斯达克 100 指数公司十年数据(2015–2025),将问题分为基本面型、交易信号型和混合型三类,采用 “先校准再扩展” 框架,结合专家种子问题、多模型生成、自我过滤和人工–LLM 判定对齐来构建 1,400 道题目。
- 关键结果:检索增强生成能大幅提升模型在基本面问题上的准确率(如 R1-Distill-Qwen 32B 提升 37%),但在交易信号问题上表现普遍下降甚至负面(如 GPT-5-mini 下降 16.4%,见论文表 2),暴露出当前 LLM 在数值与时间序列推理上的根本缺陷。
- 主要局限:基准集中在科技股为主的纳斯达克 100 指数,信号覆盖未包含宏观经济变量等外部因素,评估依赖 LLM 法官而无法完全替代专业金融分析师(见论文附录 I)。
- 适合读者:从事金融 NLP、大模型评估、量化交易信号研究或检索增强生成系统开发的研究者和工程师。
论文背景和研究动机
金融决策本质上是一个需要同时处理异质信号的复杂推理任务。一方面,公司基本面(如盈利指标、杠杆比率、估值倍数)源自监管披露文件,反映了企业的财务健康状况;另一方面,交易信号(如动量、波动率、均线)从价格和成交量数据中导出,揭示了市场情绪和资金流向。两者时常出现背离——论文以 2025 年 4 月特斯拉为例:季度 EPS 远低于预期($0.27 vs.\ $0.42),但股价反而在短期内飙升近 20%,完全由前瞻性叙事驱动(见论文第 1 节)。
然而,现有金融问答基准几乎全部偏重财务报表文本推理。FinQA、TAT-QA、ConvFinQA 等数据集聚焦于从财报表格中提取和计算会计数字;FinanceBench、FinDER 等扩展到了长文档检索,但依然不涉及交易信号。这导致一个关键问题:当前大语言模型是否能真正整合基本面与市场动态进行推理,实际上处于未被测试的状态。
论文给出的初步实验显示,即便是最先进的闭源模型,在面对 “NVIDIA 2025 年 7 月的回调是买入机会吗” 这一问题时也集体失败。多数模型无法正确识别技术指标含义,更难以做出跨信号的综合判断(见图 1)。
核心方法和技术细节
FinTradeBench 的构建遵循 “先校准后扩展” 的三阶段框架。
第一阶段——信号体系与问题分类。 基准围绕两大信号群组织:一是从 SEC 10-K/10-Q 文件中提取的 12 项公司基本面指标(如 ROE、ROA、债务权益比、账面市值比等);二是从日频 OHLCV 数据计算的 10 项交易信号(如 MACD、RSI、EMA、OBV 等,完整清单见表 6)。所有信号均按公司和财务季度对齐,确保问题答案可在历史数据中验证。
问题被分为三类:基本面型(F 型)、交易信号型(T 型)和混合型(FT 型)。每类问题要求模型从对应信号群中获取关键指标并完成推理。例如,一道混合型问题可能要求同时给出 ROE、RSI 和 EMA 的比较判断,并综合两者得出结论(见论文附录 D 的示例)。
第二阶段——校准流程。 由熟悉金融分析的专家编写 150 道种子问题(每类 50 道),每道题都附带 “金标指标” 作为评分依据。接着使用多个模型和 TELeR 提示版式(共 6 个层次,从简单指令到证据引用的全链推理,见表 7)为每道题生成候选答案,再由模型自我筛选最优回答并经过独立 LLM 的数值审计。随后,由人类专家和独立 LLM 法官(Claude Sonnet 4.5)共同对这些过滤后的答案在四个维度上(事实与数值准确性、完整性、相关性、清晰度)进行 Likert 5 点评分。两者对齐误差(MAE)约为 0.40,对应 8% 的相对偏差(见论文附录 G 表 11)。
第三阶段——规模化扩展。 将 150 道种子问题按公司与时间维度扩展至整个纳斯达克 100 指数 2015–2025 年的数据,生成 1,400 道可追溯的金融推理题目。
评估架构方面,论文设计了一个域感知混合检索系统(Dual-Track RAG)。Track A 负责从 SEC 文件中检索文本和表格内容,采用分层索引与跨编码器重排序;Track B 则专门针对结构化时间序列数据设计,通过时间感知机制提取价格片段,避免语义排序失效。两条轨道在查询时动态合并,并在生成阶段再次利用 TELeR 提示层级(表 8)产出多候选回答。
创新点和贡献
FinTradeBench 的核心创新在于它是第一个将基本面与交易信号联合推理纳入评估体系的金融基准(见论文表 1 对比)。具体贡献如下:
1. 填补了金融推理评估的空白。 之前的基准要么只考察财报数字运算,要么虽涉及长文档检索但从未要求模型处理时序价格信号。FinTradeBench 的混合型问题迫使模型必须在会计指标和市场动量之间进行权衡。
2. 整合了严谨的校准–扩展方法论。 论文没有简单依赖众包或纯 LLM 生成题目,而是通过专家种子问题、多模型自过滤、数值审计、人机对齐四道工序保障了题目质量和评分的可复现性。这一流程对后续金融领域基准的建设具有参考价值。
3. 揭示了 RAG 在金融场景中的不对称效应。 实验表明,检索增强能有效提升基于文本的基本面推理,却会恶化交易信号推理。这是一个此前未被明确证实的重要发现,对实际金融 RAG 系统的设计有直接启示。
4. 独立检测了模型架构差异。 不同模型家族(如 Qwen 与 LLaMA)对相同检索上下文的反应显著不同,暗示预训练数据成分对金融推理能力具有压倒性影响,这一点超出了单纯参数规模的解释范畴。
实验结果分析
论文对 14 个 LLM(从 1.2B 到超过 100B 参数,包含闭源和开源模型)在零样本和 RAG 两种设置下进行了系统测试,结果呈现几个清晰模式(全部数据见论文表 2):
基本面和混合推理大幅受益于检索。 在 F 型问题上,R1-Distill-Qwen (32B) 的准确率从 31.7% 提升至 43.5%(相对涨幅 37%),DeepSeek-R1 从 34% 升至 42%(+23.6%)。在混合型 FT 问题上,同一 Qwen 蒸馏模型更实现了 55.1% 的相对提升。这说明当检索到的文本与模型预训练中已编码的财务概念一致时,检索能有效激活内化知识。
交易信号推理不升反降。 几乎所有模型在 T 型问题上的 RAG 表现都低于零样本基线。以 GPT-5-mini 为例,准确率从 27.8% 降至 23.2%(-16.4%);LLaMA 3.3 Instruct (70B) 下降 18%。这一现象的根本原因是:原始价格数据对于 LLM 而言是一串缺乏语义结构的数字,模型无法在推理过程中完成指标计算,反而被噪音分散注意力。
推理能力强的模型主宰混合题。 DeepSeek-R1 及其蒸馏版本在需要跨信号综合的 FT 问题上显著优于普通指令微调模型。论文将此归因于推理类模型在回答过程中分配了额外计算步骤来调和冲突信号。
模型家族对检索敏感度迥异。 LLaMA 3.3 Instruct (70B) 在 RAG 下整体下降了 9.5%(),而 14B 的 R1-Distill-Qwen 却以更小参数量实现了高出 32% 的整体相对提升。这强烈暗示预训练数据中金融语料的覆盖度是检索有效性的前置条件(见论文第 5 节第 3 个发现)。
信息过载效应得到量化证实。 在全局质量指标上(表 3),尽管 RAG 使模型在 “基本面整合” 上提升了 13.4%,但金标指标 F1 暴跌 56.5%,推理深度下降 10.8%。模型倾向于对检索到的文档进行流畅摘要,却丢失了专家分析所需的关键信号提取和深层推理能力。
论文还通过一个苹果公司混合型问题的案例研究(表 4)直观展示了上述机理:只有在提供了预计算好的指标(理想 RAG)时,模型才能给出精确推理;标准 RAG 只给了原始文本和价格,模型就被淹没在冗余信息中而无法得出明确结论。
实践建议
对于计划将 LLM 应用于金融分析或量化决策的团队,FinTradeBench 的实验结论给出了以下工程启示:
1. 区分检索增强的使用场景。 当任务涉及报表解析、数据提取等文本密集型操作时,RAG 是有效工具。但若问题需要从 OHLCV 序列中计算技术指标,直接给模型扔原始价格表不仅无益,反而会拖累推理性能。应将指标计算放在检索前完成,将结果以结构化形式注入上下文,就像论文中 “理想 RAG” 条件下所做的那样。
2. 优先选择并微调具备链式推理能力的模型。 对于需要跨基本面和市场信号综合判断的任务,DeepSeek-R1 类推理模型的架构优势在实验中表现得相当明显。结合专业领域语料对这类模型进行指令微调,有望进一步缩小理想 RAG 与标准 RAG 之间的鸿沟。
3. 对模型家族进行审慎选型。 实验数据表明,相同参数尺度下不同模型对金融上下文的应对能力差异极大。在自有数据上进行类似于 FinTradeBench 的快速诊断,可以帮助确定该选用 Qwen 还是 LLaMA 作为基础模型,避免在错误的方向上投入大量工程资源。
4. 在 RAG 流水线中设置信号过滤层。 论文揭示的信息过载问题(金标指标 F1 下降 56.5%)强烈建议在实际系统中增加一层后处理逻辑:在生成阶段之前或之后,通过规则或小型专家模型验证回答中是否包含了关键金融指标,并抑制无关文本的权重,以此平衡 “事实扎根” 与 “推理深度”。
5. 借鉴校准–扩展方法论构建自有基准。 对于需要评估内部模型或私有数据的金融机构,论文描述的校准–扩展流程具有可移植性:先用少量专家标注题目对齐人工与自动评分,再扩展至全量数据集,可在不依赖持续人工标注的前提下维持评估可靠性。