遇见数据集

DragonData-Finance-Corpus

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

DragonData Finance Corpus 是目前最大的开放许可金融语料库,专为大型语言模型(LLM)预训练设计。该数据集由 Dragon Limited 构建,完全基于来自 50 多个国家的免费公开来源。数据内容涵盖 25 个领域,包括美国 SEC 文件(1993 年至今)、美国法院记录、美国专利全文、美国联邦政府文件、欧洲监管与法律、亚太监管、美洲监管、非洲与中东监管、学术金融论文、金融相关网页文本、金融新闻档案、全球经济指标、金融书籍与教科书、维基百科与维基媒体、金融科技代码、金融社交媒体讨论、中央银行研究、保险与精算、全球税法、全球房地产、金融科技与区块链、ESG 与可持续发展等。数据集整合了 500 多个来源,预计总 token 数超过 9300 亿。数据以二进制 shard 形式存储,每个 shard 包含 1.34 亿个 token(使用 uint16 编码),分词器为 bigcode/starcoder2-3b(词汇表 49,152)。数据集采用宽松许可(Public Domain、CC BY、CC0、BSD、Apache、MIT、OGL),适用于文本生成、标记分类、问答、摘要、文本分类等自然语言处理任务。

The DragonData Finance Corpus is the largest openly licensed financial corpus designed for pre-training large language models (LLMs). Built by Dragon Limited, it is derived entirely from free public sources across more than 50 countries. The data covers 25 domains, including U.S. SEC filings (since 1993), U.S. court records, full-text U.S. patents, U.S. federal government documents, European regulation and law, Asia-Pacific regulation, Americas regulation, Africa and Middle East regulation, academic finance papers, finance-related web text, financial news archives, global economic indicators, finance books and textbooks, Wikipedia and Wikimedia, fintech code, financial social media discussions, central bank research, insurance and actuarial science, global tax law, global real estate, fintech and blockchain, ESG and sustainability, and more. The dataset integrates over 500 sources, with an estimated total of over 930 billion tokens. The data is stored in binary shards, each containing 134 million tokens (encoded with uint16), using the tokenizer bigcode/starcoder2-3b (vocabulary size 49,152). It is distributed under permissive licenses (Public Domain, CC BY, CC0, BSD, Apache, MIT, OGL), suitable for natural language processing tasks such as text generation, token classification, question answering, summarization, and text classification.

创建时间:
2026-08-31
原始信息汇总

DragonData Finance Corpus 数据集详情

数据集概述

DragonData Finance Corpus 是由 Dragon Limited 构建的全球最大的开放金融语料库,专为大型语言模型(LLM)预训练设计。该数据集完全基于免费、公开的数据源构建,覆盖全球 50 多个国家的金融相关数据。

基本信息

属性
仓库地址 dragonlimited/DragonData-Finance-Corpus
数据集名称 DragonData Finance Corpus
语言 英语及其他多语言
许可证 CC BY 4.0(仅限宽松许可:公共领域、CC BY、CC0、BSD、Apache、MIT、OGL)
任务类型 文本生成、Token 分类、问答、摘要、文本分类
数据类型 uint16 格式的 Token ID
数据格式 二进制分片文件(data/train-XXXXX-of-00001.bin
分词器 bigcode/starcoder2-3b(词表大小 49,152)
分片大小 134M Token(268MB uint16)
领域数量 25 个
数据源数量 500+ 数据集
总 Token 数(预估) 930B+
状态 构建中
最后更新时间 2026-08-31

数据架构

DragonData-Finance-Corpus/ ├── README.md # 说明文件 ├── dataset_info.json # 数据集元数据 ├── DOMAINS.json # 领域目录(25个领域) ├── data/ │ ├── train-00000-of-00001.bin # 分片 0 │ ├── train-00001-of-00001.bin # 分片 1 │ └── ... └── metadata/ ├── domain_stats.json # 各领域 Token 统计 ├── source_registry.json # 所有数据源记录 └── build_log.json # 构建历史

Tokenization 说明

  • 使用 bigcode/starcoder2-3b 分词器
  • 词表大小为 49,152
  • 不添加特殊 Token(add_special_tokens=False
  • Token ID 以 uint16 格式的 numpy 数组存储
  • Token 按文档连续打包,文档边界通过 ##domain 头标记
  • 每个文档前带有元数据标签,格式如下:

##domain <领域标识> ##source <数据源名称> ##date <日期> ##title <标题(如有)> <文档内容>

25 个领域详情

1. SEC EDGAR 完整档案

  • 地区: 美国 | 类别: 监管文件
  • 内容: 1993 年至今所有美国上市公司的 SEC 文件(10-K、10-Q、8-K、S-1、DEF 14A、20-F、40-K、代理声明、招股说明书)
  • 主要数据源: bradfordlevy/BeanCounter(159B Token)、PleIAs/SEC(21.2 GB)、khaihernlow/financial-reports-sec(13.4 GB)、SEC EDGAR 全文搜索 API(3+ TB)
  • 预估 Token: 1,000B+
  • 状态: 构建中

2. 美国法院记录

  • 地区: 美国 | 类别: 法律
  • 内容: 所有联邦法院的 PACER/RECAP 全文法庭文件、判决书、简报、案卷
  • 主要数据源: common-pile/caselaw_access_project(77 GB,552 万行)、CourtListener/RECAP 档案、哈佛 LIL Cold Cases
  • 预估 Token: 800B+
  • 状态: 待处理

3. 美国专利全文

  • 地区: 美国 | 类别: 知识产权
  • 内容: 1790 年至今 USPTO 的完整专利授权和申请文本
  • 主要数据源: common-pile/uspto(1 TB,2030 万行)、USPTO 批量数据(1+ TB)、PatentsView API、Google Patents 公共数据
  • 预估 Token: 3,000B+
  • 状态: 待处理

4. 美国联邦政府文件

  • 地区: 美国 | 类别: 政府
  • 内容: 联邦公报、国会记录、GovInfo、法规、机构报告
  • 主要数据源: GovInfo 完整文档档案(5 TB)、联邦公报(500 GB)、国会记录(2 TB)、data.gov(5 TB)、IRS 990 批量数据(~100 GB)
  • 预估 Token: 2,500B+
  • 状态: 待处理

5. 欧洲监管与法律

  • 地区: 欧洲 | 类别: 监管
  • 内容: EUR-Lex(所有欧盟法律)、英国 Companies House、BaFin、AMF、国家监管机构、EBA/ESMA/EIOPA 报告
  • 主要数据源: EUR-Lex 全文(2 TB,CC BY 4.0)、Companies House UK(2 TB,OGL v3)、欧盟开放数据门户(5 TB)、ECB 统计数据库
  • 预估 Token: 1,200B+
  • 状态: 待处理

6. 亚太监管

  • 地区: 亚太 | 类别: 监管
  • 内容: 日本 EDINET XBRL、印度 SEBI/RBI、中国 CSRC/SSE/SZSE、韩国 FSS、新加坡 MAS、香港 HKMA
  • 主要数据源: EDINET(日本,2 TB,PDL 1.0)、India Kanoon(5 TB,CC BY-SA)、韩国 DART、HKMA 开放 API、MAS API
  • 预估 Token: 1,500B+
  • 状态: 待处理

7. 美洲监管

  • 地区: 美洲 | 类别: 监管
  • 内容: 巴西 CVM/BCB、加拿大 SEDAR+、墨西哥 CNBV、阿根廷 CNV
  • 主要数据源: CVM Brazil 完整文件(500 GB,ODbL)、BCB Brazil 开放数据(500 GB)、SEDAR+ Canada(2 TB)
  • 预估 Token: 250B+
  • 状态: 待处理

8. 非洲与中东监管

  • 地区: 非洲/中东 | 类别: 监管
  • 内容: 南非 CIPC、JSE、尼日利亚 SEC、肯尼亚 CMA、沙特 CMA、阿联酋 DFSA/ADGM
  • 主要数据源: 南非 CIPC(100 GB)、JSE 市场数据(50 GB)、沙特 CMA/Tadawul(50 GB)
  • 预估 Token: 100B+
  • 状态: 待处理

9. 学术金融论文

  • 地区: 全球 | 类别: 学术
  • 内容: arXiv q-fin、NBER、SSRN、CORE、PubMed Central 经济学、博士论文
  • 主要数据源: common-pile/arxiv_papers(31.7 万行)、CORE 全文(3370 万篇论文,2.7 TB)、Semantic Scholar S2ORC(1.8 亿篇论文,200 GB)、PubMed Central OA(500 GB)、NBER 工作论文(50 GB)
  • 预估 Token: 1,500B+
  • 状态: 待处理

10. 金融过滤的网络文本

  • 地区: 全球 | 类别: 网络
  • 内容: 从 Common Crawl / FineWeb 中提取的金融相关页面
  • 主要数据源: HuggingFaceFW/fineweb(15T Token,525 亿行)、HuggingFaceFW/fineweb-edu(1.3T Token)、allenai/dolma(~3T Token)、cerebras/SlimPajama-627B(627B Token)、EleutherAI/pile(825 GB)
  • 预估 Token: 10,000B+
  • 状态: 待处理

11. 金融新闻档案

  • 地区: 全球 | 类别: 新闻
  • 内容: GDELT 金融过滤、路透社、彭博文本、CNBC、WSJ、FT、市场评论
  • 主要数据源: Brianferrell787/financial-news-multisource(21.4 GB,5710 万行)、danidanou/Bloomberg_Financial_Newsdanidanou/Reuters_Financial_News、GDELT 完整档案(50 TB,CC BY 3.0)
  • 预估 Token: 15,000B+
  • 状态: 待处理

12. 全球经济指标

  • 地区: 全球 | 类别: 宏观
  • 内容: FRED(80 万+ 系列)、IMF、世界银行 WDI、OECD、BIS、联合国数据、全球各国统计局
  • 主要数据源: FRED(公共领域)、IMF 数据门户、世界银行 WDI(16,000+ 指标,CC BY 4.0)、OECD 数据浏览器(CC BY 4.0)、BIS 统计、DBnomics 聚合器
  • 预估 Token: 200B+
  • 状态: 待处理

13. 金融书籍与教材

  • 地区: 全球 | 类别: 书籍
  • 内容: 古腾堡计划、Open Library、OpenStax、MIT OCW、金融文献
  • 主要数据源: 古腾堡计划(70 GB,公共领域)、Open Library 全文(500 GB)、OpenStax 教材(5 GB,CC BY 4.0)、MIT OCW 金融(10 GB,CC BY-NC-SA)
  • 预估 Token: 100B+
  • 状态: 待处理

14. 维基百科与维基媒体

  • 地区: 全球 | 类别: 百科
  • 内容: 所有语言维基百科中与金融、经济、法律、商业相关的文章
  • 主要数据源: 英文维基百科(100 GB)、所有语言维基百科(10 TB,CC BY-SA 3.0)、维基词典(1 TB)
  • 预估 Token: 5,000B+
  • 状态: 待处理

15. 金融相关代码

  • 地区: 全球 | 类别: 代码
  • 内容: 来自 The Stack v2 的金融相关 GitHub 代码——量化库、交易机器人、金融科技 API
  • 主要数据源: bigcode/the-stack-v2(金融过滤后 5 TB)、bigcode/starcoderdata(~1T Token)
  • 包含关键仓库: zipline-reloaded、Backtrader、VectorBT、CCXT、Alpaca-trade-api、FinRL、Qlib、FreqTrade、Jesse
  • 预估 Token: 1,500B+
  • 状态: 待处理

16. 金融社交讨论

  • 地区: 全球 | 类别: 社交
  • 内容: Reddit(r/wallstreetbets、r/finance、r/investing、r/accounting)、Stack Exchange、Hacker News
  • 主要数据源: winddude/reddit_finance_43_250k(250 MB)、DataDump1/wallstreetbets_redditSocialGrep/reddit-wallstreetbets-aug-2021(206 MB)、Stack Exchange 数据转储(10 GB,CC BY-SA 4.0)
  • 预估 Token: 100B+
  • 状态: 待处理

17. 中央银行研究

  • 地区: 全球 | 类别: 中央银行
  • 内容: FOMC 会议记录、ECB/BoE/BoJ/RBA/PBoC 研究、BIS 论文、全球主要央行工作论文
  • 主要数据源: FOMC 完整会议记录(500 GB,公共领域)、ECB 工作论文(100 GB)、BoE 工作论文(50 GB)、BIS 工作论文(100 GB)、Fed 研究论文(500 GB)
  • 预估 Token: 100B+
  • 状态: 待处理

18. 保险与精算

  • 地区: 全球 | 类别: 保险
  • 内容: NAIC 文件、精算报告、保险法规、索赔数据
  • 主要数据源: NAIC 消费者信息来源、NAIC 市场份额报告、FEMA NFIP 数据
  • 预估 Token: 100B+
  • 状态: 待处理

19. 全球税法

  • 地区: 全球 | 类别: 税务
  • 内容: IRS 法规、OECD 税务数据库、欧盟增值税、全球国家税务机关
  • 主要数据源: IRS 税法与法规(100 GB,公共领域)、OECD 税务数据库(50 GB,CC BY 4.0)、欧盟税务数据(20 GB)、20+ 国家税务机构数据(500 GB)
  • 预估 Token: 50B+
  • 状态: 待处理

20. 全球房地产

  • 地区: 全球 | 类别: 房地产
  • 内容: FHFA HPI、Zillow、房产登记、抵押贷款数据、REIT 文件
  • 主要数据源: Zillow 研究数据、Zillow ZTRAX(100 GB)、FHFA 房价指数、Redfin 数据中心、英国土地注册局(50 GB,OGL v3)
  • 预估 Token: 20B+
  • 状态: 待处理

21. 金融科技与区块链

  • 地区: 全球 | 类别: 金融科技
  • 内容: DeFi 研究、加密货币白皮书、区块链分析、支付系统文档
  • 主要数据源: linxy/CryptoCoin(~5 GB)、BrockMisner/polymarket-crypto-5m-15m(~1 GB,2700 万行)、sebdg/trading_data(2820 万行,Apache-2.0)、StephanAkkerman/crypto-stock-tweets(800 万行)、币安公共数据
  • 预估 Token: 20B+
  • 状态: 待处理

22. ESG 与可持续发展

  • 地区: 全球 | 类别: ESG
  • 内容: CDP 披露、ESG 评级、可持续发展报告、气候数据
  • 主要数据源: WHATX/ESG_Report(51.8 MB,35 万行,MIT)、ESGBERT/governance_data(300 万行)、世界银行主权 ESG(10 MB,CC BY 4.0)

快速开始

python from datasets import load_dataset import numpy as np

ds = load_dataset("dragonlimited/DragonData-Finance-Corpus", split="train")

每个分片是 uint16 Token ID 的 .bin 文件

分词器: bigcode/starcoder2-3b (词表 49,152)

构建者

该数据集由 Dragon Limited 构建,数据来源于 50 多个国家的免费、公开数据源,仅采用宽松许可证(公共领域、CC BY、CC0、BSD、Apache、MIT、OGL),确保数据合规性。

搜集汇总
数据集介绍
DragonData-Finance-Corpus 数据集图片
构建方式
DragonData-Finance-Corpus 的构建基于对全球50余个国家公开数据源的系统性整合,涵盖SEC EDGAR、美国法院记录、专利全文、政府文件、欧洲及亚太监管文件等25个领域,汇集500余个数据集。所有文本经bigcode/starcoder2-3b分词器编码为uint16 token ID,并以134M tokens为一个分片存储为二进制文件。每个文档前置领域、来源、日期等元数据标签,确保信息溯源清晰。语料构建严格遵循许可协议,仅采用公有领域及宽松许可(如CC BY、Apache-2.0)的数据,保障合规性。
使用方法
用户可通过HuggingFace datasets库直接加载,例如使用load_dataset("dragonlimited/DragonData-Finance-Corpus", split="train")。加载后得到uint16数组,需结合starcoder2-3b的tokenizer进行解码以还原文本。每个分片覆盖134M tokens,适用于预训练或微调。通过DOMAINS.json和domain_stats.json可定位特定领域数据,按需提取。数据集中包含的##domain等标签可辅助进行领域自适应训练或指令构建。
背景与挑战
背景概述
DragonData-Finance-Corpus 是由 Dragon Limited 构建的全球最大、开放且许可宽松的金融语料库,专为大型语言模型的预训练设计。该数据集整合了来自 50 多个国家的 500 余个数据源,覆盖 25 个金融领域,包括 SEC 文件、法庭记录、专利、政府文件、学术论文、新闻、经济指标等,预计总 token 数超过 9300 亿。其创建旨在解决金融领域专业语料匮乏的问题,为金融自然语言处理研究提供全面、高质量的数据基础。该数据集的发布对金融 AI 研究具有里程碑意义,有望推动金融大模型的训练与应用发展。
当前挑战
该数据集面临多重挑战。首先,金融领域数据来源多样,格式异构,且包含大量结构化数据(如 XBRL、表格),如何高效清洗、标准化并转换为统一的文本格式是一大难题。其次,确保数据的许可合规性至关重要,需严格筛选仅采用允许性许可(如 CC BY、公共领域)的来源,避免版权风险。此外,数据规模庞大(超过 9300 亿 token),构建过程中需处理存储、计算和流式加载的工程挑战,同时保证数据质量与覆盖度,避免偏差和冗余。最后,持续更新和扩展以保持数据时效性,也是一项长期挑战。
常用场景
经典使用场景
DragonData-Finance-Corpus作为全球规模最大的开放金融语料库,专为大型语言模型的预训练而设计。其核心使用场景在于为金融领域的自然语言处理模型提供海量、多样且高质量的文本数据,覆盖从监管文件、法律判例到新闻报道、学术论文等25个细分领域。研究者可利用该语料库进行领域自适应预训练,从而提升模型在金融文本理解、生成和推理任务中的表现。该数据集采用uint16编码的二进制分片格式,配合StarCoder2-3B分词器,便于高效加载和处理,适用于构建具备金融专业知识的基座模型或进行持续预训练。
解决学术问题
该数据集解决了金融自然语言处理研究中长期面临的数据稀缺与分散问题。以往金融领域标注数据匮乏,通用语料缺乏专业性,导致模型难以捕捉金融文本中的复杂术语、法规语境和市场语义。DragonData-Finance-Corpus通过整合来自SEC、法院、专利局、中央银行等权威来源,构建了一个覆盖多语言、多司法辖区、多资产类别的统一语料库,极大丰富了金融预训练的语料多样性。这为学术研究提供了坚实的数据基础,使得模型能够学习到更全面的金融知识,从而提升在财报分析、风险识别、市场情绪预测等任务上的研究效能。
实际应用
在产业实践中,该数据集可广泛应用于智能投研、合规审查、风险评估与金融问答系统。例如,机构可利用其预训练模型自动解析SEC文件,提取关键财务指标并生成摘要;法律与合规团队可借助该语料训练文本分类模型,以识别监管文件中的风险条款;量化交易领域可通过微调预训练模型来增强对市场新闻和社交情绪的解读能力,从而辅助交易决策。此外,该数据集的开放许可和标准化格式降低了商业部署的门槛,促进了金融科技在智能客服、文档审阅、反欺诈等实际业务场景中的落地。
数据集最近研究
最新研究方向
DragonData金融语料库的构建,标志着大规模领域专用语言模型预训练数据资源的一次重大跃迁。其前沿研究方向聚焦于整合全球范围内许可宽松的金融文本,涵盖监管备案、法律判例、专利文献、宏观经济指标及另类数据等25大领域,旨在破解通用语料在金融语义理解与推理上的瓶颈。该语料库以超过9300亿tokens的庞大体量、标准化的uint16 token格式以及精细的领域元数据标记,为训练具备深厚金融素养与合规意识的大型语言模型奠定了数据基石。此举不仅推动了金融NLP从通用向专用范式的转变,亦为量化分析、风险管理及智能投顾等应用开辟了更为精准的模型演进路径,其深远影响在于重塑金融知识获取与决策支持的技术版图,促进开放科学与产业创新的深度融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务