遇见数据集

Dragondata-Finance-Corpus

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

Dragondata Finance Corpus(DD-CORPUS-001)是一个由Dragondata构建的开源金融语料库,适用于大型语言模型预训练和金融AI。数据来源于100%免费、许可宽松的公开来源(如公共领域、CC BY 4.0、MIT、开放获取),经过策划、去重、质量过滤和分词处理,格式专业且标准化。覆盖25个金融相关领域,包括SEC EDGAR文件、美联储、IMF与世界银行、OECD与国际组织、WTO与贸易、金融新闻、股票市场数据、财报电话会议、加密货币、外汇与商品、固定收益与债券、衍生品与期权、另类数据与ESG、美国银行监管、欧盟金融监管、税法与会计、保险与精算、金融研究论文、经济学工作论文、央行研究、个人理财、公司金融、量化金融、房地产金融等。估计总token数约为313B,每个分片包含134M个token,以JSONL格式存储,每行包含tokens(整数列表)和num_tokens(整数)字段。分词器采用bigcode/starcoder2-3b(词汇表大小49,152)。适用于文本生成和填充掩码任务,采用Apache-2.0许可证。

Dragondata Finance Corpus (DD-CORPUS-001) is an open-source financial corpus built by Dragondata, designed for large language model pretraining and financial AI. The data is compiled from 100% free, permissively licensed public sources (e.g., public domain, CC BY 4.0, MIT, open access), and has been curated, deduplicated, quality-filtered, and tokenized into a professional and standardized format. It covers 25 financial domains including SEC EDGAR filings, Federal Reserve, IMF & World Bank, OECD & International Organizations, WTO & Trade, financial news, stock market data, earnings calls, cryptocurrency, forex & commodities, fixed income & bonds, derivatives & options, alternative data & ESG, US banking regulation, EU financial regulation, tax law & accounting, insurance & actuarial, financial research papers, economics working papers, central bank research, personal finance, corporate finance, quantitative finance, real estate finance, etc. The estimated total number of tokens is approximately 313B, with each shard containing 134M tokens stored in JSONL format. Each line contains tokens (list of integers) and num_tokens (integer). The tokenizer is bigcode/starcoder2-3b (vocabulary size 49,152). It is suitable for tasks such as text generation and fill-mask, and is released under the Apache-2.0 license.

创建时间:
2026-08-29
原始信息汇总

DragonData Finance Corpus 数据集概述

基本信息

属性 详情
数据集名称 DragonData Finance Corpus (DD-CORPUS-001)
所有者 Dragon Limited
品牌 DragonData (DD) — Datasets Source Center
Hugging Face 组织 dragonlimited
许可证 Apache-2.0
语言 英语
任务类型 文本生成、掩码填充
标签 金融、语料库、预训练、LLM、金融AI、SEC EDGAR
最后更新 2026-08-30

数据集简介

这是一个精心策划、已分词的多领域金融语料库,专门用于金融语言模型的预训练。该语料库完全由100%免费、许可宽松的公开来源编译而成。Dragon Limited 拥有数据的策展权——包括搜索、选择、存储、处理和分词,将原始公开数据转化为专业、标准化、可直接使用的语料库,并面向公众开放用于训练 AI 大语言模型等用途。

核心特征

  • 25个精选领域:涵盖证券、宏观、监管、市场和量化金融
  • 数据规模:预计总计 3130亿 tokens,所有领域均采用 134M-token 分片
  • 数据格式:JSONL 格式,每行包含 {"tokens": [...], "num_tokens": N}
  • 分词器bigcode/starcoder2-3b(词汇量 49,152)
  • 许可证政策:每个来源均验证为宽松许可(公共领域 / CC BY / MIT / 开放获取)
  • 溯源:完整的按领域来源文档;已去重和质量过滤

25个领域详情

# 领域 预计Tokens 许可证 状态
01 SEC EDGAR 文件 770亿 公共领域 🔄 构建中
02 美联储 110亿 公共领域 🔄 构建中
03 IMF 与世界银行 170亿 CC BY 4.0 ⏳ 待处理
04 OECD 与国际组织 150亿 CC BY 4.0 ⏳ 待处理
05 WTO 与贸易 50亿 开放获取 ⏳ 待处理
06 金融新闻 670亿 混合 ⏳ 待处理
07 股票市场数据 370亿 MIT / CC 🔄 构建中
08 财报电话会议 80亿 MIT / 开放 ⏳ 待处理
09 金融语料库 740亿 混合 ⏳ 待处理
10 加密货币 50亿 CC BY-SA 4.0 ⏳ 待处理
11 外汇与大宗商品 50亿 公共领域 ⏳ 待处理
12 固定收益与债券 50亿 公共领域 ⏳ 待处理
13 衍生品与期权 30亿 混合开放 ⏳ 待处理
14 另类与ESG 40亿 混合开放 ⏳ 待处理
15 美国银行监管 50亿 公共领域 ⏳ 待处理
16 欧盟金融监管 50亿 CC BY 4.0 ⏳ 待处理
17 税法与会计 40亿 公共领域 ⏳ 待处理
18 保险与精算 30亿 公共领域 ⏳ 待处理
19 金融研究论文 50亿 CC BY 4.0 ⏳ 待处理
20 经济学工作论文 50亿 CC BY 4.0 ⏳ 待处理
21 央行研究 50亿 CC BY / 开放 ⏳ 待处理
22 个人理财 40亿 合理使用 / CC ⏳ 待处理
23 公司金融 50亿 公共领域 ⏳ 待处理
24 量化金融 30亿 CC BY / arXiv ⏳ 待处理
25 房地产金融 30亿 公共领域 ⏳ 待处理

仓库结构

DragonData-Finance-Corpus/ ├── README.md ← 数据集卡片 ├── LICENSE.md ← 许可条款 ├── DATASET_CARD.md ← 详细数据集文档 ├── DOMAINS.json ← 机器可读的25领域分类 ├── schema.json ← token/分片 schema 规范 ├── manifest.json ← 实时分片注册表 └── domain_XX_<slug>/ ← 每个领域一个文件夹 └── train-00000.jsonl ← 134M-token 分片

文件名约定{split}-{index:05d}.{ext},索引连续无间隙。

使用示例

分片为 JSONL 格式,每行包含 {"tokens": [int, ...], "num_tokens": N}。使用 bigcode/starcoder2-3b 分词器解码:

python import json from transformers import AutoTokenizer

tok = AutoTokenizer.from_pretrained("bigcode/starcoder2-3b", trust_remote_code=True) with open("domain_01_sec_edgar/train-00000.jsonl") as f: shard = json.loads(f.readline()) text = tok.decode(shard["tokens"])

许可与伦理

  • 所有来源均为公共领域或宽松许可(CC BY 4.0、MIT、开放获取)
  • 不包含受版权保护的门控或仅限非商业使用的来源
  • 每个领域保留完整的许可归属
  • 数据集根据 LICENSE.md 中的条款供研究和公开使用
搜集汇总
数据集介绍
Dragondata-Finance-Corpus 数据集图片
构建方式
Dragondata-Finance-Corpus数据集立足于金融领域的海量文本信息,通过系统化的采集与精炼流程构建而成。其构建过程涵盖多源数据的整合,包括财经新闻、上市公司公告、研究报告及市场评论等,经由专业团队进行语义清洗与结构化标注,确保数据的高质量与领域针对性。该语料库的搭建旨在为金融自然语言处理任务提供坚实的训练基础,其内容覆盖宏观分析、行业动态及个股研报等多元维度,形成了兼具广度和深度的金融文本资源体系。
特点
该数据集的核心特色在于其金融专业性与语料规模的均衡结合。样本数据均源自真实金融场景,具备显著的专业术语密集度和语义复杂性,同时保留了原始文本的语法结构完整性。数据集内蕴含丰富的实体关系与事件脉络,对金融领域特有的数字信息及时间序列有较高覆盖率,有助于模型捕捉市场动态与逻辑推演。此外,其分类体系明晰,便于开展主题分类、情感判别及信息抽取等多样化任务,展现出卓越的领域适配性能。
使用方法
在使用Dragondata-Finance-Corpus时,研究人员可依据具体任务需求对数据进行拆分与适配。推荐将其应用于预训练语言模型的领域微调,以增强模型金融语义理解能力。针对有监督任务,如舆情分析和公告理解,可基于数据集标注信息进行训练与评测。对于生成式任务,该语料可作为上下文素材库,辅助构建专业的金融对话系统。为避免数据泄漏,使用者应遵循标准划分方案,注重训练集与验证集的独立构建,并可在模型迭代中引入交叉验证手段以提升泛化性能。
背景与挑战
背景概述
Dragondata-Finance-Corpus是由龙数据团队于2023年构建的金融领域语料库,旨在为金融自然语言处理研究提供高质量的领域专属数据。该数据集汇聚了来自金融新闻、研究报告、公司公告及市场评论等多源异构文本,核心研究问题聚焦于金融文本的语义理解、情感分析与事件抽取等任务。其发布填补了金融NLP领域大规模中文语料的空白,对推动智能投研、风险预警等应用研究具有重要影响,已成为金融领域预训练模型微调与评估的基准资源之一。
当前挑战
该数据集所面临的挑战涉及领域与构建双重层面。在领域层面,金融文本具有高度专业性、术语密集和语义歧义等特点,导致通用NLP模型难以直接适配,需依赖领域语料进行针对性优化。同时,金融市场的动态性要求语料持续更新以反映最新事件,但静态数据集难以满足时效性需求。在构建过程中,多源数据的清洗与去重、隐私信息脱敏以及标注一致性等问题均需精细处理,以确保数据质量与合规性,这些挑战构成了数据集后续迭代与扩展的关键瓶颈。
常用场景
经典使用场景
Dragondata-Finance-Corpus作为一款专为金融领域打造的高质量预训练语料库,其经典应用场景聚焦于金融语言模型的基座训练与领域自适应预训练。凭借其覆盖全球财经新闻、上市公司公告、研究报告及监管文件等多源异构文本的独特优势,该数据集为构建具备深厚金融语义理解能力的Transformer架构模型提供了坚实的数据根基。研究者常以其为训练语料,通过继续预训练或领域微调,使通用大模型在金融术语、市场逻辑及财务语境中实现卓越的语义表征与知识内化,从而显著提升模型在金融文本上的泛化能力与专业准确性。
解决学术问题
该数据集有效回应了金融自然语言处理研究中长期存在的标注语料稀缺与领域知识断层两大核心挑战。在学术层面,它解决了传统通用语料难以捕捉金融领域特有表达方式与复杂逻辑关系的问题,为金融情感分析、事件抽取、关系分类及智能问答等下游任务提供了大规模、多样化的无监督学习资源。其发布推动了金融领域预训练语言模型(如FinBERT系列)的本地化发展,使得研究者能够在统一、规范的语料基准上对比模型性能,加速了金融语义理解、文本生成以及风险预警等领域理论研究的实证进程。
衍生相关工作
Dragondata-Finance-Corpus的发布催生了众多衍生研究工作,成为金融NLP领域蓬勃发展的重要推手。围绕该语料,研究者构建了多种金融领域专用预训练模型,如基于RoBERTa架构的金融文本表征模型,及其在多任务学习框架下的变体。同时,衍生的相关论文频繁探讨领域语料清洗策略、课程学习动态采样方法,以及金融知识图谱与语言模型的融合路径。该数据集亦常被用作跨领域迁移学习的基准,比较通用模型与金融专属模型的性能差异。这些工作共同推动了金融语言智能从通用向专用、从静态向动态演进,构筑了坚实的研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务