FinRank
收藏资源简介:
FinRank是一个面向金融问答与检索的证据导向基准数据集,由多所国际研究机构联合构建。该数据集包含1185条人工撰写的问答记录,覆盖22家公司在制药、石油天然气和汽车行业的10-K与10-Q申报文件,每条记录均配有参考答案、黄金支持段落及手工精选的困难负样本,这些负样本源自不同公司、会计期间或文件类型的易混淆段落。数据集创建遵循预设标准,严格控制主题覆盖面、难度分级(易/中/难比例为30%/40%/30%)与证据范围(单段/两段/多段比例为40%/30%/30%),并包含推理类型、难度等级等丰富元数据。FinRank旨在评估检索与重排序系统在金融场景下的证据区分能力,尤其针对模板化披露中的困难负样本抑制问题,为构建更可靠的金融问答系统提供标准化评测平台。
FinRank is an evidence-oriented benchmark dataset for financial question answering and retrieval, jointly constructed by multiple international research institutions. This dataset contains 1,185 manually authored question-answer records, covering 10-K and 10-Q filings of 22 companies across the pharmaceutical, oil & gas, and automotive industries. Each record is equipped with a reference answer, gold standard supporting paragraphs, and hand-curated hard negative samples, which are derived from confusing paragraphs from different companies, accounting periods, or document types. The dataset was created following preset standards, with strict controls over topic coverage, difficulty grading (with a ratio of 30% easy, 40% medium, 30% hard), and evidence scope (with a ratio of 40% single-paragraph, 30% two-paragraph, 30% multi-paragraph), and includes rich metadata such as reasoning types and difficulty levels. FinRank aims to evaluate the evidence discrimination capability of retrieval and re-ranking systems in financial scenarios, particularly addressing the issue of hard negative sample suppression in templated disclosures, providing a standardized evaluation platform for building more reliable financial question answering systems.
数据集概述:FinRank
FinRank是一个面向金融领域问答与检索的基准测试数据集,专注于美国证券交易委员会(SEC)文件中的证据支撑型问答任务。
核心规模
- 包含 1,185条 人工撰写的问答记录
- 覆盖 22家 美国上市公司,横跨三个行业:制药、油气与汽车
- 数据来源于2024至2025年间的10-K和10-Q文件
- 每条记录平均包含1.96个黄金支撑段落(gold supporting passages)
- 共提供 6,021条 人工精选的困难负样本,平均每条记录5.08条
特点与创新
- 首个 为金融QA基准发布逐问题精选困难负样本的数据集
- 明确定义了重排序(reranking)和困难负样本判别任务,区别于仅做段落检索的基准
- 每条记录附带丰富元数据:主题(8类)、难度等级(易/中/难)、推理类型(定性/定量)、证据范围(单/双/多段落)、文件类型、报告年份
- 69%的记录包含黄金子问题分解(query_rewrite)
困难负样本分类
| 关系类型 | 数量 | 占比 |
|---|---|---|
| 同行业不同公司 | 4,807 | 79.8% |
| 同公司不同年份/表格 | 794 | 13.2% |
| 同公司同年同表 | 419 | 7.0% |
| 跨行业 | 1 | <0.1% |
其中442条负样本(7.3%)与其他记录的支撑段落空白字符完全相同(属于重复样板文本),可通过hn_taxonomy.json中的重叠标志进行过滤。
文件构成
- FinRank.jsonl:主数据集,含1,185条记录,每条记录包含稳定的
passage_id和text_sha1标识 - repair_log.json:记录所有数据规范化与修复过程
- hn_taxonomy.json:每个困难负样本的分类和跨记录重叠标志
- summary.json:标签统计和交叉汇总
- baselines/:评估代码、验证器、数据划分及实验结果
评估方式
- 段落检索:在全局池化语料库C(共5,230个唯一段落,为支撑段落与困难负样本的并集)上进行,属于精心构建的压力测试而非完整文件检索
- 重排序/困难负样本判别:在记录内的候选集(黄金段落加困难负样本)中评估,使用MRR、nDCG@5和成对准确率指标
数据来源与限制
- 由五位商科学生完全人工撰写,基于共享的生成标准,过程中有教师抽样审查
- 已知局限:单标注者、无正式标注者间一致性检验
- 经确定性事后处理排除了65条记录,排除原因包括:依赖非文件外部来源(52条)、合成负样本(3条)、占位符内容(3条)、重复问答对(4条)、困难负样本不足(3条)
许可与引用
- 采用 CC BY-NC 4.0 许可,允许学术和教育用途,商业使用需另行授权
- 不包含非公开的个人信息,SEC文件本身属于公共记录
论文链接:https://arxiv.org/abs/2608.07400




