遇见数据集

trading-data

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

DartLab数据集是一个结构化的公司披露数据集合,源自韩国金融监督院的DART(电子披露系统)和美国证券交易委员会的EDGAR(电子数据收集、分析与检索系统)。该数据集作为DartLab Python库的数据层,旨在将公开的公司披露文件转化为统一、结构化的公司信息图谱。数据集包含约2,700家韩国公司和970家美国公司的数据,总计涵盖近3,000家公司。数据以Parquet文件格式组织,每个文件对应一家公司(通过股票代码标识)。数据集分为三个主要子集:1) **docs**:包含年度/季度报告中的全文章节,解析为结构化的文本块(如文本、表格、标题),涵盖约2,547家公司,数据量约8 GB。关键字段包括披露ID、申报日期、股票代码、公司名称、报告类型、章节标题、内容(Markdown格式)、区块类型和年份。2) **finance**:包含基于XBRL的财务报表数据(如资产负债表、损益表、现金流量表),源自DART OpenAPI,涵盖约2,744家公司,数据量约586 MB。关键字段包括业务年份、报告季度代码、财务报表类型(合并或单独)、科目ID、科目名称(韩语)以及当期、前期和更早期间的金额。3) **report**:包含28种DART API类别的结构化披露数据,涉及公司治理、薪酬、持股等方面,涵盖约2,711家公司,数据量约319 MB。关键字段包括API类型(如股息、员工、高管)、年份、季度、股票代码和公司代码,以及各类别特定的列。数据集适用于表格问答、文本分类、财务分析、公司信息披露研究等任务,支持韩语和英语。数据每日通过GitHub Actions自动更新,确保包含最近7天内的新披露文件。所有数据均保持原始申报文件中的数值,未经四舍五入、估算或插值处理。数据集采用Apache 2.0许可证。

The DartLab dataset is a structured collection of corporate disclosure data, sourced from DART (Data Analysis, Retrieval and Transfer System) operated by the Korean Financial Supervisory Service and EDGAR (Electronic Data Gathering, Analysis, and Retrieval) by the U.S. Securities and Exchange Commission. It serves as the data layer for the DartLab Python library, aiming to transform public corporate disclosure documents into a unified, structured corporate information graph. The dataset includes data from approximately 2,700 Korean companies and 970 U.S. companies, totaling nearly 3,000 companies. Data is organized in Parquet file format, with each file corresponding to a company (identified by stock ticker). The dataset is divided into three main subsets: 1) **docs**: Contains full-text sections from annual/quarterly reports, parsed into structured text blocks (e.g., text, tables, headings), covering about 2,547 companies with a data volume of approximately 8 GB. Key fields include disclosure ID, filing date, stock ticker, company name, report type, section title, content (in Markdown format), block type, and year. 2) **finance**: Includes XBRL-based financial statement data (e.g., balance sheets, income statements, cash flow statements), sourced from DART OpenAPI, covering about 2,744 companies with a data volume of approximately 586 MB. Key fields include business year, report quarter code, financial statement type (consolidated or separate), account ID, account name (in Korean), and amounts for the current, previous, and earlier periods. 3) **report**: Contains structured disclosure data from 28 DART API categories, covering areas such as corporate governance, compensation, and shareholding, with about 2,711 companies and a data volume of approximately 319 MB. Key fields include API type (e.g., dividend, employee, executive), year, quarter, stock ticker, company code, and category-specific columns. The dataset is suitable for tasks such as table question answering, text classification, financial analysis, and corporate disclosure research, supporting both Korean and English. Data is automatically updated daily via GitHub Actions to include new disclosure files from the past 7 days. All data retains the original values from the filing documents, without rounding, estimation, or interpolation. The dataset is licensed under Apache 2.0.

创建时间:
2026-06-18
原始信息汇总

数据集概述:DartLab 전자공시 데이터 (DartLab Data)

该数据集由 DartLab 库提供支持,是经过预处理的结构化企业披露数据,涵盖韩国 (DART) 和美国 (EDGAR) 的上市公司信息。数据集以 Apache Parquet 格式存储。

  • 任务类型:表格问答、文本分类
  • 语言:韩语、英语
  • 许可证:Apache-2.0
  • 数据规模:1,000 到 10,000 条记录

数据来源

  • 韩国 DART:韩国金融监督院运营的电子披露系统 (dart.fss.or.kr)
  • 美国 EDGAR:美国证券交易委员会的电子数据收集分析和检索系统 (sec.gov/edgar)
  • 所有数据均来自公开的政府披露系统,财务数据保持原始申报文件原样,未做四舍五入、估算或插值。

数据结构

数据集分为三个主要子集,每个文件代表一家公司,文件名为 {股票代码}.parquet

子集名称 覆盖公司数 数据大小 描述
dart/docs/ 2,547 家 约 8 GB 年度/季度报告全文,解析为结构化区块 (文本、表格、标题)
dart/finance/ 2,744 家 约 586 MB 基于 XBRL 的财务报表(资产负债表、损益表、现金流量表等)
dart/report/ 2,711 家 约 319 MB 28 种 DART 结构化披露 API 数据(治理、薪酬、股权等)
  • docs 子集列:rcept_no (申报编号), rcept_date (申报日期), stock_code (股票代码), corp_name (公司名), report_type (报告类型), section_title (章节标题), section_order (章节顺序), content (章节文本), blockType (区块类型), year (年份)
  • finance 子集列:bsns_year (业务年度), reprt_code (报告季度代码), stock_code (股票代码), corp_name (公司名), fs_div (财务报告类别:合并/个别), sj_div (报表类型), account_id (XBRL 账户 ID), account_nm (账户名,韩语), thstrm_amount (本期金额), frmtrm_amount (上期金额), bfefrmtrm_amount (前两期金额)
  • report 子集包含 28 种 API 类型,包括:dividend (股息), employee (员工), executive (高管), majorHolder (大股东), treasuryStock (库存股), capitalChange (资本变动), auditOpinion (审计意见), stockTotal (股票总数), outsideDirector (外部董事), corporateBond (公司债券) 等

更新计划

通过 GitHub Actions 每日自动检查并增量收集最近 7 天的申报文件。

搜集汇总
数据集介绍
trading-data 数据集图片
构建方式
该数据集源自 DartLab 库,利用韩国 DART(전자공시)与美国 SEC EDGAR 两大公开披露系统,将企业提交的监管文件转化为结构化的 Parquet 文件。通过调用 DART OpenAPI 接口(如 fnlttSinglAcntAll)以及解析 EDGAR 的 XBRL 数据,系统自动提取财务报表、全文章节及治理、薪酬、股权等 28 类披露信息。每一家公司对应一个以股票代码命名的 parquet 文件,涵盖了约 2,700 家韩国企业和 970 家美国企业,数据经 GitHub Actions 每日增量更新,确保时效性与完整性。
使用方法
用户可直接从 HuggingFace 数据集仓库下载 Parquet 文件,或借助 DartLab Python 库以高效方式访问。只需实例化 dartlab.Company 并传入股票代码(如 '005930'),库便会自动从本仓库拉取对应 parquet 文件,返回完整的结构化数据。此外,数据支持表格问答与文本分类等任务,适用于金融分析、监管科技及自然语言处理研究。详细的文档和示例代码可在 DartLab 的 GitHub Pages 上获取,便于快速上手。
背景与挑战
背景概述
在金融市场分析中,企业公开披露数据(如财务报告、治理结构)是量化研究、投资决策与监管合规的核心依据。然而,韩国DART与美国EDGAR两大电子披露系统虽蕴藏海量信息,却因其结构异构、跨市场整合成本高昂,长期制约了跨国金融研究的高效开展。由eddmpython团队创建的DartLab数据集,依托同名开源Python库于2024年前后发布,首次将韩美两国约3,700家上市公司的年度/季度报告全文、XBRL财务表及28类结构化披露API(如股利、高管持股、外部董事信息)统一转化为Parquet格式的公司级数据地图。该数据集通过每日增量更新的GitHub Actions流水线,显著降低了跨境金融数据获取的门槛,在金融科技与计算社会科学领域引发了广泛关注,为多市场财务对比、ESG分析及自然语言处理在监管文本中的应用提供了标准化基石。
当前挑战
本数据集面临的核心挑战涵盖领域问题与构建过程双重维度。领域层面,金融披露数据长期受制于跨监管体系(韩国FSS vs. 美国SEC)的文档格式差异(如XBRL标签不兼容、报告章节命名各异),传统方法需人工逐项对齐,难以规模化支撑多市场量化模型训练。构建过程中,需解决DART OpenAPI的速率限制与EDGAR的增量更新碎片化问题,确保每日自动同步时2700家韩国公司与970家美国公司的文本、财务表及28类API数据在Parquet嵌套结构中保持一致性;此外,XBRL金额字段的原始精度保留(无插值、无四舍五入)与中文/英双语标注任务(如table-question-answering)的跨语言对齐亦构成技术难点,要求数据管道在鲁棒性之上兼顾存储效率与查询性能。
常用场景
经典使用场景
在金融与会计研究领域,基于结构化与非结构化文本的融合分析日益成为洞察企业行为的关键。trading-data数据集通过系统整合韩国DART与美国EDGAR两大官方电子披露系统的年报、季报全文、XBRL财务数据及28类结构化治理信息,为研究者提供了一站式的企业级数据视图。其最经典的应用场景聚焦于利用披露文本的段落级标记(如文本、表格、标题)与多维财务指标,构建公司层面的全景特征图谱。这一设计使得研究者能够高效地检索特定披露区块,或将文本语义与财务数字进行联合建模,从而为分析企业信息环境、披露策略及市场响应提供了坚实的数据基础。
解决学术问题
该数据集致力于破解金融与会计研究中长期存在的‘数据碎片化’难题。传统上,企业披露文本、财务报表与治理指标分散于不同接口或格式中,且跨市场(韩美)的比较研究因数据规范差异而举步维艰。trading-data通过统一的数据框架(Parquet格式)和标准化的字段设计,将文本块的类型(text/table/heading)与财务账户体系(基于XBRL)无缝衔接,使得研究者能够直接探索文本特征与财务绩效之间的内生关系。这一突破不仅降低了数据获取与预处理的门槛,更促进了披露文本信息含量、管理层语调、公司治理有效性等议题的跨国实证研究,对理解全球资本市场的微观运行机制具有深远的学术意义。
实际应用
在量化投资与金融科技领域,trading-data数据集展现出极高的实际应用价值。通过DartLab库提供的便捷接口,量化分析师可将个股的披露文本(如管理层讨论与分析部分)与财务指标(如营收、负债)实时对齐,构建事件驱动的交易信号。例如,基于近期新增的XBRL账户数据,可快速计算关键财务比率的变化趋势,并利用文本语义分析识别财报中隐藏的风险信号。此外,28类结构化披露数据(如高管薪酬、股利政策、外部董事信息)使得企业治理评级模型的构建成为可能。该数据集已成为连接学术研究与工业实践的桥梁,被广泛应用于韩美市场的智能投研系统、监管科技(RegTech)以及企业信用风险评估等领域。
数据集最近研究
最新研究方向
在金融科技与监管科技深度融合的前沿浪潮中,trading-data数据集通过系统整合韩国DART与美国EDGAR两大核心电子化信息披露系统的结构化企业数据,为跨市场财务分析、XBRL语义理解及多语言公司治理研究提供了标准化数据层。该数据集涵盖超过2700家韩国企业和970家美国企业的财务报表、文本披露与治理指标,当前正驱动着自动化财报问答、企业事件预测及跨国对比分析等热点研究方向。其每日自动更新的机制与Parquet格式的高效存储,使得研究者能够以前所未有的粒度追踪企业动态,推动从传统基本面分析向基于大规模结构化披露数据的智能决策范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务