DragonData-Finance-Corpus
收藏资源简介:
DragonData Finance Corpus 是目前最大的开放许可金融语料库,专为大型语言模型(LLM)预训练设计。该数据集由 Dragon Limited 构建,完全基于来自 50 多个国家的免费公开来源。数据内容涵盖 25 个领域,包括美国 SEC 文件(1993 年至今)、美国法院记录、美国专利全文、美国联邦政府文件、欧洲监管与法律、亚太监管、美洲监管、非洲与中东监管、学术金融论文、金融相关网页文本、金融新闻档案、全球经济指标、金融书籍与教科书、维基百科与维基媒体、金融科技代码、金融社交媒体讨论、中央银行研究、保险与精算、全球税法、全球房地产、金融科技与区块链、ESG 与可持续发展等。数据集整合了 500 多个来源,预计总 token 数超过 9300 亿。数据以二进制 shard 形式存储,每个 shard 包含 1.34 亿个 token(使用 uint16 编码),分词器为 bigcode/starcoder2-3b(词汇表 49,152)。数据集采用宽松许可(Public Domain、CC BY、CC0、BSD、Apache、MIT、OGL),适用于文本生成、标记分类、问答、摘要、文本分类等自然语言处理任务。
The DragonData Finance Corpus is the largest openly licensed financial corpus designed for pre-training large language models (LLMs). Built by Dragon Limited, it is derived entirely from free public sources across more than 50 countries. The data covers 25 domains, including U.S. SEC filings (since 1993), U.S. court records, full-text U.S. patents, U.S. federal government documents, European regulation and law, Asia-Pacific regulation, Americas regulation, Africa and Middle East regulation, academic finance papers, finance-related web text, financial news archives, global economic indicators, finance books and textbooks, Wikipedia and Wikimedia, fintech code, financial social media discussions, central bank research, insurance and actuarial science, global tax law, global real estate, fintech and blockchain, ESG and sustainability, and more. The dataset integrates over 500 sources, with an estimated total of over 930 billion tokens. The data is stored in binary shards, each containing 134 million tokens (encoded with uint16), using the tokenizer bigcode/starcoder2-3b (vocabulary size 49,152). It is distributed under permissive licenses (Public Domain, CC BY, CC0, BSD, Apache, MIT, OGL), suitable for natural language processing tasks such as text generation, token classification, question answering, summarization, and text classification.
DragonData Finance Corpus 数据集详情
数据集概述
DragonData Finance Corpus 是由 Dragon Limited 构建的全球最大的开放金融语料库,专为大型语言模型(LLM)预训练设计。该数据集完全基于免费、公开的数据源构建,覆盖全球 50 多个国家的金融相关数据。
基本信息
| 属性 | 值 |
|---|---|
| 仓库地址 | dragonlimited/DragonData-Finance-Corpus |
| 数据集名称 | DragonData Finance Corpus |
| 语言 | 英语及其他多语言 |
| 许可证 | CC BY 4.0(仅限宽松许可:公共领域、CC BY、CC0、BSD、Apache、MIT、OGL) |
| 任务类型 | 文本生成、Token 分类、问答、摘要、文本分类 |
| 数据类型 | uint16 格式的 Token ID |
| 数据格式 | 二进制分片文件(data/train-XXXXX-of-00001.bin) |
| 分词器 | bigcode/starcoder2-3b(词表大小 49,152) |
| 分片大小 | 134M Token(268MB uint16) |
| 领域数量 | 25 个 |
| 数据源数量 | 500+ 数据集 |
| 总 Token 数(预估) | 930B+ |
| 状态 | 构建中 |
| 最后更新时间 | 2026-08-31 |
数据架构
DragonData-Finance-Corpus/ ├── README.md # 说明文件 ├── dataset_info.json # 数据集元数据 ├── DOMAINS.json # 领域目录(25个领域) ├── data/ │ ├── train-00000-of-00001.bin # 分片 0 │ ├── train-00001-of-00001.bin # 分片 1 │ └── ... └── metadata/ ├── domain_stats.json # 各领域 Token 统计 ├── source_registry.json # 所有数据源记录 └── build_log.json # 构建历史
Tokenization 说明
- 使用
bigcode/starcoder2-3b分词器 - 词表大小为 49,152
- 不添加特殊 Token(
add_special_tokens=False) - Token ID 以
uint16格式的 numpy 数组存储 - Token 按文档连续打包,文档边界通过
##domain头标记 - 每个文档前带有元数据标签,格式如下:
##domain <领域标识> ##source <数据源名称> ##date <日期> ##title <标题(如有)> <文档内容>
25 个领域详情
1. SEC EDGAR 完整档案
- 地区: 美国 | 类别: 监管文件
- 内容: 1993 年至今所有美国上市公司的 SEC 文件(10-K、10-Q、8-K、S-1、DEF 14A、20-F、40-K、代理声明、招股说明书)
- 主要数据源:
bradfordlevy/BeanCounter(159B Token)、PleIAs/SEC(21.2 GB)、khaihernlow/financial-reports-sec(13.4 GB)、SEC EDGAR 全文搜索 API(3+ TB) - 预估 Token: 1,000B+
- 状态: 构建中
2. 美国法院记录
- 地区: 美国 | 类别: 法律
- 内容: 所有联邦法院的 PACER/RECAP 全文法庭文件、判决书、简报、案卷
- 主要数据源:
common-pile/caselaw_access_project(77 GB,552 万行)、CourtListener/RECAP 档案、哈佛 LIL Cold Cases - 预估 Token: 800B+
- 状态: 待处理
3. 美国专利全文
- 地区: 美国 | 类别: 知识产权
- 内容: 1790 年至今 USPTO 的完整专利授权和申请文本
- 主要数据源:
common-pile/uspto(1 TB,2030 万行)、USPTO 批量数据(1+ TB)、PatentsView API、Google Patents 公共数据 - 预估 Token: 3,000B+
- 状态: 待处理
4. 美国联邦政府文件
- 地区: 美国 | 类别: 政府
- 内容: 联邦公报、国会记录、GovInfo、法规、机构报告
- 主要数据源: GovInfo 完整文档档案(5 TB)、联邦公报(500 GB)、国会记录(2 TB)、data.gov(5 TB)、IRS 990 批量数据(~100 GB)
- 预估 Token: 2,500B+
- 状态: 待处理
5. 欧洲监管与法律
- 地区: 欧洲 | 类别: 监管
- 内容: EUR-Lex(所有欧盟法律)、英国 Companies House、BaFin、AMF、国家监管机构、EBA/ESMA/EIOPA 报告
- 主要数据源: EUR-Lex 全文(2 TB,CC BY 4.0)、Companies House UK(2 TB,OGL v3)、欧盟开放数据门户(5 TB)、ECB 统计数据库
- 预估 Token: 1,200B+
- 状态: 待处理
6. 亚太监管
- 地区: 亚太 | 类别: 监管
- 内容: 日本 EDINET XBRL、印度 SEBI/RBI、中国 CSRC/SSE/SZSE、韩国 FSS、新加坡 MAS、香港 HKMA
- 主要数据源: EDINET(日本,2 TB,PDL 1.0)、India Kanoon(5 TB,CC BY-SA)、韩国 DART、HKMA 开放 API、MAS API
- 预估 Token: 1,500B+
- 状态: 待处理
7. 美洲监管
- 地区: 美洲 | 类别: 监管
- 内容: 巴西 CVM/BCB、加拿大 SEDAR+、墨西哥 CNBV、阿根廷 CNV
- 主要数据源: CVM Brazil 完整文件(500 GB,ODbL)、BCB Brazil 开放数据(500 GB)、SEDAR+ Canada(2 TB)
- 预估 Token: 250B+
- 状态: 待处理
8. 非洲与中东监管
- 地区: 非洲/中东 | 类别: 监管
- 内容: 南非 CIPC、JSE、尼日利亚 SEC、肯尼亚 CMA、沙特 CMA、阿联酋 DFSA/ADGM
- 主要数据源: 南非 CIPC(100 GB)、JSE 市场数据(50 GB)、沙特 CMA/Tadawul(50 GB)
- 预估 Token: 100B+
- 状态: 待处理
9. 学术金融论文
- 地区: 全球 | 类别: 学术
- 内容: arXiv q-fin、NBER、SSRN、CORE、PubMed Central 经济学、博士论文
- 主要数据源:
common-pile/arxiv_papers(31.7 万行)、CORE 全文(3370 万篇论文,2.7 TB)、Semantic Scholar S2ORC(1.8 亿篇论文,200 GB)、PubMed Central OA(500 GB)、NBER 工作论文(50 GB) - 预估 Token: 1,500B+
- 状态: 待处理
10. 金融过滤的网络文本
- 地区: 全球 | 类别: 网络
- 内容: 从 Common Crawl / FineWeb 中提取的金融相关页面
- 主要数据源:
HuggingFaceFW/fineweb(15T Token,525 亿行)、HuggingFaceFW/fineweb-edu(1.3T Token)、allenai/dolma(~3T Token)、cerebras/SlimPajama-627B(627B Token)、EleutherAI/pile(825 GB) - 预估 Token: 10,000B+
- 状态: 待处理
11. 金融新闻档案
- 地区: 全球 | 类别: 新闻
- 内容: GDELT 金融过滤、路透社、彭博文本、CNBC、WSJ、FT、市场评论
- 主要数据源:
Brianferrell787/financial-news-multisource(21.4 GB,5710 万行)、danidanou/Bloomberg_Financial_News、danidanou/Reuters_Financial_News、GDELT 完整档案(50 TB,CC BY 3.0) - 预估 Token: 15,000B+
- 状态: 待处理
12. 全球经济指标
- 地区: 全球 | 类别: 宏观
- 内容: FRED(80 万+ 系列)、IMF、世界银行 WDI、OECD、BIS、联合国数据、全球各国统计局
- 主要数据源: FRED(公共领域)、IMF 数据门户、世界银行 WDI(16,000+ 指标,CC BY 4.0)、OECD 数据浏览器(CC BY 4.0)、BIS 统计、DBnomics 聚合器
- 预估 Token: 200B+
- 状态: 待处理
13. 金融书籍与教材
- 地区: 全球 | 类别: 书籍
- 内容: 古腾堡计划、Open Library、OpenStax、MIT OCW、金融文献
- 主要数据源: 古腾堡计划(70 GB,公共领域)、Open Library 全文(500 GB)、OpenStax 教材(5 GB,CC BY 4.0)、MIT OCW 金融(10 GB,CC BY-NC-SA)
- 预估 Token: 100B+
- 状态: 待处理
14. 维基百科与维基媒体
- 地区: 全球 | 类别: 百科
- 内容: 所有语言维基百科中与金融、经济、法律、商业相关的文章
- 主要数据源: 英文维基百科(100 GB)、所有语言维基百科(10 TB,CC BY-SA 3.0)、维基词典(1 TB)
- 预估 Token: 5,000B+
- 状态: 待处理
15. 金融相关代码
- 地区: 全球 | 类别: 代码
- 内容: 来自 The Stack v2 的金融相关 GitHub 代码——量化库、交易机器人、金融科技 API
- 主要数据源:
bigcode/the-stack-v2(金融过滤后 5 TB)、bigcode/starcoderdata(~1T Token) - 包含关键仓库: zipline-reloaded、Backtrader、VectorBT、CCXT、Alpaca-trade-api、FinRL、Qlib、FreqTrade、Jesse
- 预估 Token: 1,500B+
- 状态: 待处理
16. 金融社交讨论
- 地区: 全球 | 类别: 社交
- 内容: Reddit(r/wallstreetbets、r/finance、r/investing、r/accounting)、Stack Exchange、Hacker News
- 主要数据源:
winddude/reddit_finance_43_250k(250 MB)、DataDump1/wallstreetbets_reddit、SocialGrep/reddit-wallstreetbets-aug-2021(206 MB)、Stack Exchange 数据转储(10 GB,CC BY-SA 4.0) - 预估 Token: 100B+
- 状态: 待处理
17. 中央银行研究
- 地区: 全球 | 类别: 中央银行
- 内容: FOMC 会议记录、ECB/BoE/BoJ/RBA/PBoC 研究、BIS 论文、全球主要央行工作论文
- 主要数据源: FOMC 完整会议记录(500 GB,公共领域)、ECB 工作论文(100 GB)、BoE 工作论文(50 GB)、BIS 工作论文(100 GB)、Fed 研究论文(500 GB)
- 预估 Token: 100B+
- 状态: 待处理
18. 保险与精算
- 地区: 全球 | 类别: 保险
- 内容: NAIC 文件、精算报告、保险法规、索赔数据
- 主要数据源: NAIC 消费者信息来源、NAIC 市场份额报告、FEMA NFIP 数据
- 预估 Token: 100B+
- 状态: 待处理
19. 全球税法
- 地区: 全球 | 类别: 税务
- 内容: IRS 法规、OECD 税务数据库、欧盟增值税、全球国家税务机关
- 主要数据源: IRS 税法与法规(100 GB,公共领域)、OECD 税务数据库(50 GB,CC BY 4.0)、欧盟税务数据(20 GB)、20+ 国家税务机构数据(500 GB)
- 预估 Token: 50B+
- 状态: 待处理
20. 全球房地产
- 地区: 全球 | 类别: 房地产
- 内容: FHFA HPI、Zillow、房产登记、抵押贷款数据、REIT 文件
- 主要数据源: Zillow 研究数据、Zillow ZTRAX(100 GB)、FHFA 房价指数、Redfin 数据中心、英国土地注册局(50 GB,OGL v3)
- 预估 Token: 20B+
- 状态: 待处理
21. 金融科技与区块链
- 地区: 全球 | 类别: 金融科技
- 内容: DeFi 研究、加密货币白皮书、区块链分析、支付系统文档
- 主要数据源:
linxy/CryptoCoin(~5 GB)、BrockMisner/polymarket-crypto-5m-15m(~1 GB,2700 万行)、sebdg/trading_data(2820 万行,Apache-2.0)、StephanAkkerman/crypto-stock-tweets(800 万行)、币安公共数据 - 预估 Token: 20B+
- 状态: 待处理
22. ESG 与可持续发展
- 地区: 全球 | 类别: ESG
- 内容: CDP 披露、ESG 评级、可持续发展报告、气候数据
- 主要数据源:
WHATX/ESG_Report(51.8 MB,35 万行,MIT)、ESGBERT/governance_data(300 万行)、世界银行主权 ESG(10 MB,CC BY 4.0)
快速开始
python from datasets import load_dataset import numpy as np
ds = load_dataset("dragonlimited/DragonData-Finance-Corpus", split="train")
每个分片是 uint16 Token ID 的 .bin 文件
分词器: bigcode/starcoder2-3b (词表 49,152)
构建者
该数据集由 Dragon Limited 构建,数据来源于 50 多个国家的免费、公开数据源,仅采用宽松许可证(公共领域、CC BY、CC0、BSD、Apache、MIT、OGL),确保数据合规性。




