遇见数据集

dartlab-data

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

DartLab数据集是一个结构化的金融披露数据集,整合了韩国DART(电子披露系统)和美国SEC EDGAR(电子数据收集、分析和检索系统)的公开披露信息。该数据集旨在通过单一的股票代码,提供可跨市场比较的标准化表格数据,格式为Parquet。数据集内容涵盖韩国所有上市公司(约2,700家)和美国主要上市公司(约1,000家)的多种金融和商业信息,主要包括:财务报表(如资产负债表、利润表、现金流量表)、业务报告正文、结构化披露(如股息、高管信息)、股价数据、宏观经济指标、市场指数以及研究报告元数据。数据按公司和类别组织为多个Parquet文件,核心结构包括韩国DART数据、美国SEC EDGAR数据、韩国市场股价和指数数据、宏观经济时间序列数据和研究报告元数据。数据直接从官方公共披露系统获取,保持原始值,每日自动更新。适用于表格问答、文本分类、金融分析、跨市场比较、风险管理、宏观经济研究等任务,可通过Python库、URL或Web数据中心访问,采用Apache 2.0许可证。

The DartLab Dataset is a structured financial disclosure dataset that integrates public disclosure information from Korea’s DART (Electronic Disclosure System) and the U.S. SEC EDGAR (Electronic Data Gathering, Analysis, and Retrieval System). This dataset aims to provide standardized tabular data enabling cross-market comparison via a single stock ticker, in Parquet format. It covers diverse financial and business information of all listed companies in South Korea (approximately 2,700) and major listed companies in the U.S. (approximately 1,000), mainly including: financial statements (e.g., balance sheet, income statement, cash flow statement), full texts of business reports, structured disclosures (e.g., dividends, executive information), stock price data, macroeconomic indicators, market indices, and research report metadata. The data is organized into multiple Parquet files by company and category, with its core structure comprising South Korea’s DART data, U.S. SEC EDGAR data, South Korean market stock price and index data, macroeconomic time series data, and research report metadata. The data is directly obtained from official public disclosure systems, retains original values, and is automatically updated on a daily basis. It is applicable to tasks such as tabular question answering, text classification, financial analysis, cross-market comparison, risk management, and macroeconomic research. It can be accessed via Python libraries, URLs, or web data centers, and is licensed under the Apache 2.0 License.

创建时间:
2026-07-02
原始信息汇总

数据集概述:DartLab 전자공시 데이터

该数据集由 DartLab 项目提供,将韩国 DART(金融监督院电子披露系统)和美国 SEC EDGAR 的披露数据,按股票代码统一为可比较的表格格式,并以 Parquet 格式存储。

核心内容

  • 覆盖范围:约 2,700 家韩国上市公司和约 1,000 家美国主要上市公司的财务报表、业务报告正文、结构化披露、股价及宏观经济指标。
  • 数据容量:包含超过 100 万条记录,且所有数值均保持原始数据,不进行四舍五入、估算或插值。
  • 更新频率:通过 GitHub Actions 每日自动更新,增量收集最新披露信息。

数据组织与结构

数据集按路径划分为多个子目录,每个 Parquet 文件通常对应一家公司(股票代码命名),部分如股价和宏观经济数据则按日期或序列组织。

  • dart/:韩国 DART 披露数据

    • panel/:披露信息水平化处理,每个公司 17 列,包含正文与 XBRL 表格。
    • finance/:K-IFRS XBRL 格式的财务报表(资产负债表、利润表、现金流量表)。
    • report/:28 种结构化披露 API 数据(如股息、高管、股权)。
    • scan/:面向所有上市公司的预计算横截面数据(如比率、盈余质量)。
  • edgar/:美国 SEC EDGAR 数据

    • panel/:披露信息水平化处理,跨市场 16 列。
    • financeStmt/:与 DART finance 同构标准化的美国财务报表。
    • prices/:各公司日级别 OHLCV 数据。
    • tickers/:Ticker 到 CIK 的映射表。
  • gov/ & krx/:股价与指数(源自公共数据门户和 KRX)

    • prices/company/:各公司日级别 OHLCV 及市值。
    • prices/date/:按日期分片的每日全市场数据。
    • indices/:KOSPI、KOSDAQ 等指数的日级别序列。
  • macro/:宏观经济时间序列

    • fred/:美国 FRED(利率、物价等)。
    • ecos/:韩国银行 ECOS。
    • customs/:韩国海关月度进出口数据。
  • research/

    • brokerage/:证券公司研究报告的元数据索引(标题、链接、发表日期,不包含正文)。

关键特性

  • 无代码访问:可通过网页端“数据中心”直接预览、筛选并下载 CSV 或 Excel 格式数据,或通过“终端”功能一键导出公司相关数据。Google Sheets 可借助 IMPORTDATA() 函数实现约 1 小时间隔的自动刷新。
  • Python 使用:通过 dartlab.Company("股票代码") 自动下载并缓存所需 Parquet 文件;也支持使用 Polars、DuckDB 等工具直接读取原始 Parquet 文件。
  • 数据来源:全部源自公开的政府或公共披露系统(韩国 DART、美国 SEC EDGAR、公共数据门户、KRX、FRED、ECOS、海关),不包含新闻正文以规避版权问题。
  • 许可协议:Apache 2.0。

数据列示例

dart/panel(披露水平化) 包含以下主要列: corp, period, rceptNo, chapter, sectionLeaf, sectionPath, leafType (text/table), blockLeaf, xbrlClass, disclosureKey, contentRaw

dart/finance(财务报表) 包含以下主要列: bsns_year, reprt_code, stock_code, corp_name, fs_div (CFS/OFS), sj_div (BS/IS/CF/SCE), account_id, account_nm, thstrm_amount, frmtrm_amount, bfefrmtrm_amount

dart/report(结构化披露) 包含以下主要列: apiType, year, quarter, stockCode, corpCode,以及其他按 API 类型变化的字段。覆盖 28 种 API,包括 dividend, employee, executive, majorHolder, treasuryStock 等。

搜集汇总
数据集介绍
dartlab-data 数据集图片
构建方式
DartLab 데이터셋은 한국의 금융감독원 DART 전자공시 시스템과 미국 SEC의 EDGAR 공시 시스템으로부터 수집된 방대한 기업 공시 데이터를 기반으로 구축되었습니다. 데이터 수집 및 가공 과정은 DartLab 라이브러리를 통해 자동화되었으며, 모든 정보는 종목코드(Stock Code)를 기준으로 통합되어 일관된 테이블 형태의 Parquet 파일로 변환되었습니다. 특히, DART와 EDGAR에서 추출한 재무제표, 사업보고서 본문, 정형 공시 정보는 XBRL 태그와 원문을 함께 보존하면서 수평화(Panel) 구조로 가공되었고, 주가 및 거시경제 지표는 각각 공공데이터포털, KRX, FRED, ECOS 등에서 수집되어 동일한 시간 축 위에 정렬되었습니다. 모든 숫자 데이터는 원문 그대로 보존되어 반올림이나 보간이 가해지지 않았습니다.
特点
이 데이터셋의 가장 두드러진 특징은 한국과 미국의 상장사 공시 정보를 단일 종목코드로 연결하여 비교 가능한 형태로 제공한다는 점입니다. 약 2,700개의 한국 상장사와 1,000개의 미국 주요 상장사에 대해 재무제표, 사업보고서 본문, 정형 공시(배당, 임원, 지분 등), 일별 OHLCV 주가 데이터, 그리고 FRED, ECOS, 관세청에서 수집한 거시경제 시계열이 한데 모여 있습니다. 데이터는 회사 단위의 Parquet 파일로 분할되어 있어 필요한 종목만 선택적으로 다운로드할 수 있으며, 코드 없이도 웹 인터페이스를 통해 데이터를 탐색하고 CSV나 엑셀 형식으로 내려받을 수 있는 점이 큰 장점입니다. 또한, GitHub Actions를 통해 매일 자동 갱신되어 최신 공시 내용이 항상 반영됩니다.
使用方法
데이터셋 활용은 크게 세 가지 경로로 가능합니다. 첫째, Python 환경에서 DartLab 라이브러리를 설치하고 `dartlab.Company("005930")`와 같이 종목코드를 호출하면, 라이브러리가 필요한 Parquet 파일을 Hugging Face에서 자동으로 내려받아 로컬에 캐시합니다. 이후 `c.panel()`, `c.panel("IS")` 등으로 재무제표나 사업 보고서 본문을 즉시 조회할 수 있습니다. 둘째, 코드 없이도 웹 기반의 데이터 센터(Data Center)를 방문하여 관심 있는 종목과 항목을 선택한 뒤 CSV나 엑셀 파일로 직접 다운로드하거나, 구글시트에서 `IMPORTDATA()` 함수를 이용해 라이브 API로 데이터를 불러올 수 있습니다. 셋째, Polars나 DuckDB 같은 도구를 사용해 Parquet 파일의 직접 URL을 읽어 들이는 방식으로도 데이터에 접근할 수 있으며, 엑셀 365의 데이터 가져오기 기능을 통해서도 활용 가능합니다.
背景与挑战
背景概述
在金融分析领域,企业公开披露数据是评估公司基本面、进行跨市场比较与量化研究的基础。然而,全球主要资本市场——如韩国的DART与美国的SEC EDGAR——其公示数据格式异构、语言不同且获取门槛较高,长期以来缺乏一个统一、标准化且易于访问的数据集。DartLab数据集由此应运而生,由开发团队于2024年创建,依托GitHub Actions实现每日自动化更新,致力于将两国上市公司披露的财务报表、业务报告、结构化公告、股价及宏观经济指标整合为统一的Parquet格式。该数据集覆盖韩国约2,700家上市公司及美国约1,000家主要企业,其核心创新在于允许通过单个股票代码跨市场查询结构化面板数据,大幅降低了跨境金融研究的复杂度,对计量经济学、自然语言处理及多模态金融分析等领域产生了深远影响。
当前挑战
该数据集所应对的首要领域挑战在于构建一个可比较的跨国财务信息基础设施:DART与EDGAR分别使用K-IFRS和US GAAP会计准则,财报科目命名与分类体系存在本质差异,且报告语言(韩语与英语)不同,这给自动化对齐与标准化带来了巨大困难。其次,在构建过程中,数据集面临多重技术挑战:XBRL标签的多源性容易导致数据冲突,需设计精巧的映射规则;DART与EDGAR的API调用频率限制要求开发高效率的增量爬取策略;此外,确保数字原文保留(不进行四舍五入或插值)的同时,还需处理缺失值、合并财年与日历年的对齐问题。最后,数据集的持续维护需应对两国机构API的接口变更,以及财报更新周期的异步性,这要求构建一个鲁棒的流水线来保证数据的一致性与时效性。
常用场景
经典使用场景
DartLab数据集整合了韩国DART与美国SEC EDGAR两大监管机构的公司披露数据,为金融与会计领域的研究者提供了一站式的结构化数据平台。其最经典的使用场景是跨市场公司财务分析与比较研究,通过统一的‘股票代码’作为键值,研究者能够轻松地将韩国与美国上市公司的财务报表、XBRL标签数据、非结构化报告文本以及市场行情进行横向对齐。这种设计极大地简化了以往需要分别从多个异构源抓取、清洗和标准化数据的繁琐过程,使得跨国资本市场的比较研究不再受限于数据壁垒。
解决学术问题
该数据集有效解决了金融与会计学术研究中长期存在的‘数据碎片化’与‘语境鸿沟’难题。一方面,它通过将原始XBRL表格与叙述性报告文本整合入同一数据面板,使得研究者能够同时捕捉定量财务指标与定性管理讨论之间的关联,从而更精确地检测盈余管理、文本语气与市场异象的耦合关系。另一方面,跨市场的数据对齐能力为检验不同监管环境下信息披露质量的差异、国际会计准则趋同效果以及全球资本市场的联动性提供了坚实的数据基础,推动了诸如信息效率、信号传递和制度比较等经典理论的实证验证。
衍生相关工作
围绕DartLab数据集已经衍生出多项经典工作,主要集中在‘多模态披露分析’与‘金融语言模型’两个方向。研究者利用其内嵌的文本与数值对偶结构,训练了用于财务报告摘要生成、关键指标抽取以及情感分析的专用Transformer模型,例如在公告文本上微调KoBERT或FinBERT,以预测盈余公告后的股价反应。此外,该数据集也被用于构建知识图谱,通过实体解析技术将分散于不同报告页面中的高管信息、股权变动与关联交易进行关联,从而支撑公司治理质量的自动化评估。这些衍生工作反过来又促进了金融数据科学工具链的完善,如开发更高性能的XBRL解析器与市场异象数据库。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务