遇见数据集

FinRank

收藏
arXiv2026-08-08 更新2026-08-11 收录
数据链接:
官方服务:

资源简介:

FinRank是一个面向金融问答与检索的证据导向基准数据集,由多所国际研究机构联合构建。该数据集包含1185条人工撰写的问答记录,覆盖22家公司在制药、石油天然气和汽车行业的10-K与10-Q申报文件,每条记录均配有参考答案、黄金支持段落及手工精选的困难负样本,这些负样本源自不同公司、会计期间或文件类型的易混淆段落。数据集创建遵循预设标准,严格控制主题覆盖面、难度分级(易/中/难比例为30%/40%/30%)与证据范围(单段/两段/多段比例为40%/30%/30%),并包含推理类型、难度等级等丰富元数据。FinRank旨在评估检索与重排序系统在金融场景下的证据区分能力,尤其针对模板化披露中的困难负样本抑制问题,为构建更可靠的金融问答系统提供标准化评测平台。

FinRank is an evidence-oriented benchmark dataset for financial question answering and retrieval, jointly constructed by multiple international research institutions. This dataset contains 1,185 manually authored question-answer records, covering 10-K and 10-Q filings of 22 companies across the pharmaceutical, oil & gas, and automotive industries. Each record is equipped with a reference answer, gold standard supporting paragraphs, and hand-curated hard negative samples, which are derived from confusing paragraphs from different companies, accounting periods, or document types. The dataset was created following preset standards, with strict controls over topic coverage, difficulty grading (with a ratio of 30% easy, 40% medium, 30% hard), and evidence scope (with a ratio of 40% single-paragraph, 30% two-paragraph, 30% multi-paragraph), and includes rich metadata such as reasoning types and difficulty levels. FinRank aims to evaluate the evidence discrimination capability of retrieval and re-ranking systems in financial scenarios, particularly addressing the issue of hard negative sample suppression in templated disclosures, providing a standardized evaluation platform for building more reliable financial question answering systems.

创建时间:
2026-08-08
原始信息汇总

数据集概述:FinRank

FinRank是一个面向金融领域问答与检索的基准测试数据集,专注于美国证券交易委员会(SEC)文件中的证据支撑型问答任务。

核心规模

  • 包含 1,185条 人工撰写的问答记录
  • 覆盖 22家 美国上市公司,横跨三个行业:制药、油气与汽车
  • 数据来源于2024至2025年间的10-K和10-Q文件
  • 每条记录平均包含1.96个黄金支撑段落(gold supporting passages)
  • 共提供 6,021条 人工精选的困难负样本,平均每条记录5.08条

特点与创新

  • 首个 为金融QA基准发布逐问题精选困难负样本的数据集
  • 明确定义了重排序(reranking)和困难负样本判别任务,区别于仅做段落检索的基准
  • 每条记录附带丰富元数据:主题(8类)、难度等级(易/中/难)、推理类型(定性/定量)、证据范围(单/双/多段落)、文件类型、报告年份
  • 69%的记录包含黄金子问题分解(query_rewrite)

困难负样本分类

关系类型 数量 占比
同行业不同公司 4,807 79.8%
同公司不同年份/表格 794 13.2%
同公司同年同表 419 7.0%
跨行业 1 <0.1%

其中442条负样本(7.3%)与其他记录的支撑段落空白字符完全相同(属于重复样板文本),可通过hn_taxonomy.json中的重叠标志进行过滤。

文件构成

  • FinRank.jsonl:主数据集,含1,185条记录,每条记录包含稳定的passage_idtext_sha1标识
  • repair_log.json:记录所有数据规范化与修复过程
  • hn_taxonomy.json:每个困难负样本的分类和跨记录重叠标志
  • summary.json:标签统计和交叉汇总
  • baselines/:评估代码、验证器、数据划分及实验结果

评估方式

  • 段落检索:在全局池化语料库C(共5,230个唯一段落,为支撑段落与困难负样本的并集)上进行,属于精心构建的压力测试而非完整文件检索
  • 重排序/困难负样本判别:在记录内的候选集(黄金段落加困难负样本)中评估,使用MRR、nDCG@5和成对准确率指标

数据来源与限制

  • 由五位商科学生完全人工撰写,基于共享的生成标准,过程中有教师抽样审查
  • 已知局限:单标注者、无正式标注者间一致性检验
  • 经确定性事后处理排除了65条记录,排除原因包括:依赖非文件外部来源(52条)、合成负样本(3条)、占位符内容(3条)、重复问答对(4条)、困难负样本不足(3条)

许可与引用

  • 采用 CC BY-NC 4.0 许可,允许学术和教育用途,商业使用需另行授权
  • 不包含非公开的个人信息,SEC文件本身属于公共记录

论文链接:https://arxiv.org/abs/2608.07400

搜集汇总
数据集介绍
FinRank 数据集图片
构建方式
在金融监管披露的复杂语境中,美国证券交易委员会(SEC)的10-K和10-Q文件构成企业财务分析的核心依据,其模板化表述与跨公司、跨期间的相似披露为证据溯源带来严峻挑战。为此,FinRank基准数据集应运而生,旨在甄别支撑答案的确凿证据与貌似合理的干扰项。该数据集汇集了22家分属制药、油气与汽车行业的公司,覆盖2024至2025财年的10-K与10-Q文件,经五位训练有素的标注员人工撰写了共计1185条问答记录。每条记录均精心配置了参考答案、金标准支持段落,以及从同类可比文件中人工遴选出的困难负样本,这些负样本多来自同行业竞争对手的同期文件、同一公司不同报告期或不同文件类型的段落,从而精准模拟了现实分析场景中的混淆源。整个构建过程严格遵循预设的准则文档,对主题类别、推理类型(定性/定量)、难度层级(30/40/30易/中/难比例)及证据覆盖范围(40/30/30单/双/多段落比例)均设有明确目标,并附有详细的元数据、查询重写分解与可复现的标签规范化流程,确保数据集的质量与科学严谨性。
特点
FinRank数据集的核心特色在于其开创性的证据中心设计,首次为金融问答领域提供了每道问题专属的人工精选困难负样本集。这些负样本体系性地覆盖了跨公司、跨期间及跨文件类型的混淆情形,其中约80%集中于“同行业不同公司”的维度,直接挑战检索模型在高度模板化文本中的判别能力。数据集包含丰富的分层标注信息,涵盖文件类型、推理类型、证据范围、难度等级等轴向,且为69%的记录提供了金标准子问题分解,使得性能剖析能够深入至细粒度层面。此外,数据披露了统一的官方标签规范化管道、机器可读的修复日志、文档内持久的段落标识符及文本哈希,并附有硬负样本分类学与分布审计,确保了基准的可审计性、透明度与可扩展性。这些特性共同使FinRank超越了单纯的端到端正确性评估,专注衡量证据检索、重排序与困难负样本抑制的独立效能。
使用方法
FinRank数据集旨在支撑金融问答与检索系统的多维度评估,其使用方式明确区分了全局证据池与记录内候选集两类评测场景。研究者可基于全局去重后的5230条段落池,执行标准的检索任务,报告Recall@k、MRR及nDCG@10等指标;亦可聚焦于每条记录的黄金段落与困难负样本所构成的候选集,开展重排序与判别能力测试,采用MRR、nDCG@5及成对准确率等度量。数据集的多任务设计涵盖段落检索、重排序、多段落推理、答案生成与查询重写五大评估协议,并提供了随机、留出股票代码、留出行业、按年份及按文件类型等多种划分模式,便于泛化性验证与误差分析。官方提供了完整的端到端可复现基线脚本,覆盖稀疏检索(TF-IDF、BM25)、稠密编码器、跨编码器重排序等模型,并支持对元数据预过滤、查询重写消融及硬/随机负样本对比等实验设计的灵活配置,为金融领域证据溯源研究铺设了坚实而富有挑战性的测试平台。
背景与挑战
背景概述
FinRank数据集由荷兰格罗宁根大学、德国法兰克福大学及哈勒经济研究所等机构的研究人员于2026年联合构建,旨在解决金融监管文件问答中证据溯源这一核心难题。该基准针对美国证券交易委员会(SEC)的10-K和10-Q文件,覆盖制药、油气及汽车三大行业的22家企业,包含1,185条人工撰写的问答记录。每条记录均配有参考答案、黄金支持段落及精心挑选的困难负样本,这些负样本多取自同行业其他公司或不同报告期的相似披露内容,以考察检索系统在高度模板化的金融文本中区分证据来源的能力。FinRank的问世填补了金融问答基准在证据鉴别与硬负样本评测方面的空白,其发布为检索增强生成(RAG)技术在金融领域的可靠应用提供了具有里程碑意义的评估基准。
当前挑战
构建FinRank面临多重挑战。一方面,金融文件问答的领域难题在于监管披露的高度模板化,相似事实和表述反复出现在不同章节、不同报告期及可比公司之间,致使证据鉴别远比答案生成更为关键,现有基准多侧重数字计算或端到端正确性,难以孤立评测证据检索与硬负样本抑制能力。另一方面,数据构建过程亦颇为艰巨:需人工阅读海量长篇文件(每份10-K常达数百页),准确提取支持段落并手工挑选具有语义混淆性的负样本,同时还需确保标签一致性、覆盖均衡性与元数据丰富度。最终构建的负样本中近80%来自同行业其他公司,充分体现了该领域证据甄别的难度。
常用场景
经典使用场景
FinRank作为首个面向SEC文件检索与问答的证据本位基准,其经典使用场景聚焦于验证检索增强生成系统在高度模板化的金融披露文本中的证据溯源能力。研究者在评估模型时,需在包含5230个候选段落的全局池中,针对1185个手工标注的问题-答案对进行召回与重排序,并特别关注对同行业不同公司、不同报告期等语义混淆性负样本的甄别。该基准创新性地将检索、重排序与硬负样本判别设为独立评测任务,使研究者能够精准剖析系统在证据定位与干扰抑制环节的薄弱之处,从而推动金融领域信息检索技术的精细化发展。
实际应用
在实际应用层面,FinRank为金融分析师助手、合规问答工具以及SEC文件搜索界面提供了坚实的评估基石。该基准模拟真实分析师工作流,要求模型在庞杂且结构相似的10-K与10-Q文件中精准定位支持性证据,并规避来自竞争对手或前期期间的干扰段落。通过采纳FinRank进行评估,相关系统能够提升对披露信息溯源的可审计性与可信赖度,进而在审计、合规审查与投资者关系管理等高风险场景中,辅助专业人员快速核验信息、降低误判风险,同时保持人类监督的不可或缺性。
衍生相关工作
FinRank的发布催生了一系列衍生研究工作,深刻影响着金融信息检索与问答领域的发展方向。其首创的逐问题人工精选硬负样本机制,启发了后续研究者探索约束感知的重排序方法,如FinCARDS将证据选择重构为约束满足问题;同时,基准中丰富的元数据(如难度、推理类型、证据范围)促进了分维度性能剖析研究,推动了对聚合指标背后模型短板的深入洞察。此外,FinRank所强调的证据优先原则,也为多模态表格与图文证据的扩展评估、以及RAG系统引用忠实度度量提供了参照框架,促进了金融AI系统向可靠、可解释方向的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务