遇见数据集

dartlab-data

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

DartLab数据集是由DartLab项目将韩国金融监督院电子披露系统(DART)和美国证券交易委员会EDGAR系统的公开披露数据加工而成的结构化数据集。它以Parquet格式提供,使得用户可以通过一个股票代码同时访问韩国和美国的披露数据。数据集包含韩国所有上市公司(约2700家)和美国主要上市公司(约1000家)的财务报表、业务报告正文、结构化披露信息、股价、宏观指标等。数据规模约为100万至1000万条记录。数据集按公司组织,每个文件对应一个公司(部分数据按日期或序列组织)。主要子集包括:dart/panel(韩国披露水平化数据,包含公司、期间、接受编号、章节、内容等字段)、dart/finance(韩国XBRL财务数据,包含年度、报告代码、股票代码、公司名、合并/单独、报表类型、账户ID、金额等)、dart/report(韩国28种结构化披露API数据,如分红、员工、高管等,包含API类型、年份、季度等)、edgar/panel(美国披露水平化数据)、edgar/financeStmt(美国标准化财务报表)、edgar/prices(美国每日OHLCV股价)、gov/prices(韩国每日OHLCV及市值)、macro/fred、macro/ecos、macro/customs(宏观时间序列)等。所有数据均来自公开的政府或公共披露系统,财务数值保持原始精度,无四舍五入、估计或插值。数据集每日通过GitHub Actions自动增量更新。许可证为CC BY 4.0,允许自由使用和再分发,但需注明出处。该数据集适用于金融分析、表格问答、文本分类、量化研究等任务。

The DartLab dataset is a structured dataset processed by the DartLab project from public disclosure data of the Korean Financial Supervisory Services electronic disclosure system (DART) and the U.S. Securities and Exchange Commissions EDGAR system. It is provided in Parquet format, allowing users to access Korean and U.S. disclosure data simultaneously using a single stock ticker. The dataset includes financial statements, business report texts, structured disclosure information, stock prices, and macroeconomic indicators for all listed companies in Korea (approximately 2,700) and major U.S. listed companies (approximately 1,000). The data size is approximately 1 million to 10 million records. The dataset is organized by company, with each file corresponding to a company (some data organized by date or sequence). Main subsets include: dart/panel (Korean disclosure flattened data with fields like company, period, acceptance number, section, content), dart/finance (Korean XBRL financial data with year, report code, ticker, company name, consolidation/separate, statement type, account ID, amount), dart/report (Korean 28 types of structured disclosure API data such as dividends, employees, executives, with API type, year, quarter), edgar/panel (U.S. disclosure flattened data), edgar/financeStmt (U.S. standardized financial statements), edgar/prices (U.S. daily OHLCV stock prices), gov/prices (Korean daily OHLCV and market cap), macro/fred, macro/ecos, macro/customs (macroeconomic time series), etc. All data comes from public government or public disclosure systems, financial values maintain original precision without rounding, estimation, or interpolation. The dataset is incrementally updated daily via GitHub Actions. Licensed under CC BY 4.0, allowing free use and redistribution with attribution. Suitable for financial analysis, table question answering, text classification, quantitative research, etc.

创建时间:
2026-08-23
原始信息汇总

DartLab 전자공시 데이터셋

数据集概述

DartLab 전자공시 데이터셋은 한국 DART(금융감독원 전자공시시스템)와 미국 SEC EDGAR 공시 데이터를 종목코드 하나로 비교 가능한 형태로 가공한 Parquet 형식의 구조화된 데이터셋입니다. 한국 전체 상장사 약 2,700개사와 미국 주요 상장사 약 1,000개사의 재무제표, 사업보고서 본문, 정형 공시, 주가, 거시지표를 포함합니다.

数据规模与结构

数据量

  • 샘플 수: 약 100만~1000만 건

数据路径结构

dart/ 한국 DART 공시 ├── panel/ 공시 수평화 (회사당 17-col, 본문 + XBRL 한 표) ├── finance/ 재무제표 (K-IFRS XBRL: BS·IS·CF) ├── report/ 정형 공시 (28종 API: 배당·임원·지분 등) └── scan/ 전 상장사 횡단 프리빌드

edgar/ 미국 SEC EDGAR ├── panel/ 공시 수평화 (회사당 16-col, cross-market) ├── financeStmt/ 재무제표 (DART finance 와 동형 표준화) ├── prices/ 회사별 일별 OHLCV └── tickers/ ticker↔CIK 맵

gov/ · krx/ 시세·지수 ├── prices/company/ 회사별 일별 OHLCV + 시가총액 ├── prices/date/ 일별 전종목 (날짜 샤딩) └── indices/ KOSPI·KOSDAQ 등 지수 일별

macro/ 거시경제 시계열 ├── fred/ 미국 FRED (금리·물가 등) ├── ecos/ 한국은행 ECOS └── customs/ 관세청 월별 수출입

research/ └── brokerage/ 증권사 리서치 메타 인덱스 (제목·링크·발간일, 본문 없음)

核心数据内容

dart/panel - 공시 수평화 데이터

DART 정기보고서를 회사 단위 패널로 수평화한 데이터로, 서술 본문과 XBRL 연결 표가 함께 포함됩니다.

주요 컬럼: corp(종목코드), period(기간 키), rceptNo(DART 접수번호), chapter(보고서 장), sectionLeaf(원본 섹션 제목), sectionPath(섹션 경로), leafType(text/table), blockLeaf(블록·표 제목), xbrlClass(XBRL 클래스), disclosureKey(표준 키), contentRaw(원본 XML/텍스트)

dart/finance - 재무제표 데이터

DART OpenAPI 기반 XBRL 재무 데이터로, 연결(CFS)과 별도(OFS) 재무제표를 포함합니다.

주요 컬럼: bsns_year(사업연도), reprt_code(보고서 분기 코드), stock_code(종목코드), corp_name(회사명), fs_div(CFS/OFS), sj_div(재무제표 구분: BS/IS/CF/SCE), account_id(XBRL 계정 ID), account_nm(계정명), thstrm_amount(당기 금액), frmtrm_amount(전기 금액), bfefrmtrm_amount(전전기 금액)

dart/report - 정형 공시 데이터

지배구조, 보수, 지분, 배당 등을 다루는 DART API 28종의 데이터입니다.

주요 컬럼: apiType(API 분류), year(연도), quarter(분기), stockCode(종목코드), corpCode(DART 고유번호)

28종 API 목록: dividend, employee, executive, majorHolder, treasuryStock, capitalChange, auditOpinion, stockTotal, outsideDirector, corporateBond 등

기타 데이터

  • edgar/panel: 미국 공시 본문 수평화 (회사당 16-col)
  • edgar/financeStmt: 미국 재무제표 (DART finance와 동형 표준화)
  • edgar/prices/company: 미국 회사별 일별 OHLCV
  • gov/prices/company: 한국 회사별 일별 OHLCV + 시가총액
  • gov/indices/index: KOSPI·KOSDAQ 등 지수별 일별 시계열
  • macro/fred · macro/ecos · macro/customs: 미국·한국·무역 거시 시계열
  • research/brokerage: 증권사 리서치 링크 인덱스 (월별, 본문 없음)

数据使用方式

Python 라이브러리 사용

python import dartlab

c = dartlab.Company("005930") # 삼성전자, HF 에서 자동 다운로드 c.panel() # 공시 항목 × 기간 전체 격자 c.panel("IS") # 손익계산서 (finance 정규화 숫자) c.panel("사업") # 사업 개요 등 공시 본문 행 검색

Parquet 직접 읽기

python import polars as pl url = "https://huggingface.co/datasets/eddmpython/dartlab-data/resolve/main/dart/finance/005930.parquet" df = pl.read_parquet(url)

数据来源与更新

数据来源

  • DART (한국): dart.fss.or.kr · 금융감독원 전자공시시스템
  • EDGAR (미국): sec.gov/edgar · SEC 전자공시 시스템
  • 시세·지수: 공공데이터포털·KRX
  • 거시: 미국 FRED, 한국은행 ECOS, 관세청

更新周期

GitHub Actions로 매일 자동 갱신되며, 최근 공시를 증분으로 확인·수집합니다.

数据特性

  • 모든 데이터는 공개된 정부·공공 공시 시스템에서 가져온 것입니다.
  • 재무 수치는 원문 그대로 보존됩니다 (반올림·추정·보간 없음).
  • 뉴스 본문은 언론사 저작권 때문에 데이터셋에 포함하지 않습니다.

许可信息

데이터는 CC BY 4.0 라이선스를 따릅니다. 자유롭게 사용·재배포가 가능하되 출처(dartlab)를 표기해야 합니다. 라이브러리 코드는 Apache 2.0 라이선스입니다.

任务类型

  • 표 질의 응답 (table-question-answering)
  • 텍스트 분류 (text-classification)

语言

  • 한국어 (ko)
  • 영어 (en)
搜集汇总
数据集介绍
dartlab-data 数据集图片
构建方式
该数据集由DartLab项目构建,旨在将韩国DART与美国SEC EDGAR的公开披露信息整合为结构化数据。数据集以Parquet格式存储,每家公司对应一个文件,内容涵盖财务报告、业务报告文本、正式披露、股价及宏观经济指标。其构建过程高度自动化,通过GitHub Actions每日更新,增量收集最新披露,并严格保留原始数值,不进行任何舍入或估算。整体上,该数据集是DartLab库的数据层,用户可通过`dartlab.Company("005930")`调用自动下载所需Parquet文件,实现跨市场数据对比分析。
特点
该数据集最显著的特点是其跨市场兼容性,同时覆盖韩国约2,700家上市公司与美国约1,000家主要企业,数据规模庞大(1M<N<10M)。其结构设计精巧,将文本披露与XBRL财务报表整合于同一面板中,便于统一检索与比较。此外,数据集的多样性也是一大优势,除财务数据外,还包含股价、指数、宏观经济及证券研究报告元数据,为金融研究提供了全面的数据底座。尤其值得一提的是,所有数据均来自公开的政府及监管机构,确保了来源的权威性与可靠性。
使用方法
该数据集的使用方式灵活多样。对于熟悉Python的用户,可通过DartLab库自动获取并缓存所需Parquet文件,无需API密钥。同时,用户也可直接通过URL读取Parquet,支持Polars、DuckDB等工具,甚至可集成到Excel 365中进行数据导入。对于非编程用户,数据集提供了网页版数据中心,支持按公司、项目筛选数据,并可将结果导出为CSV或Excel格式,还能生成可供Google Sheets或curl调用的实时API链接,极大地降低了使用门槛,满足了从数据分析师到普通投资者的广泛需求。
背景与挑战
背景概述
DartLab电子公示数据集由eddmpython团队创建,旨在整合韩国DART与美国SEC EDGAR两大金融监管体系的公开披露数据。该数据集以Parquet格式存储,覆盖约2700家韩国上市公司与1000家美国主要企业,包含财务报表、业务报告全文、结构化披露、股价及宏观经济指标等丰富信息。其核心研究问题在于实现跨国界、跨市场的财务数据标准化与可比性,为金融分析、量化研究及人工智能模型训练提供统一的数据基础。自发布以来,该数据集因其高完整性(原始数据未做任何平滑处理)与每日自动更新机制,在金融科技与学术研究领域产生了广泛影响,成为连接东方与西方资本市场信息披露的重要桥梁。
当前挑战
该数据集面临的挑战首先体现在跨市场监管框架的差异上:韩国DART的XBRL分类标准与美国SEC的EDGAR体系在会计科目、报告周期及披露粒度上存在显著差异,如何设计统一的标准化映射方案同时保持原始语义不失真,是构建阶段的首要难题。其次,数据规模庞大且维度复杂,涵盖横向的时间序列与纵向的跨公司面板数据,需要在确保数据质量的前提下实现高效存储与检索,这对数据仓库架构提出了严苛要求。此外,原始文本与数值混合的披露信息,如何通过自动化管道精准提取并保持文档结构完整性也颇具挑战。在更新层面,每日增量同步既需应对监管机构系统的异构性,又要规避数据延迟与版本冲突,同时确保长期可追溯性与许可合规性,这对运维体系构成了持续性考验。
常用场景
经典使用场景
DartLab 데이터셋은 한국 DART 및 미국 SEC EDGAR 전자공시 데이터를 종목코드 단위로 통합한 정형 파케이(Parquet) 아카이브로, 금융 자연어 처리 및 테이블 기반 질의응답 연구의 핵심 자원으로 활용된다. 연구자들은 이 데이터셋을 통해 재무제표 XBRL 원문, 사업보고서 본문, 주가·거시지표 시계열을 회사별·기간별로 정렬된 구조적 표로 접근할 수 있어, 기업 공시 정보를 입력으로 하는 테이블 질의응답(TQA) 모델의 훈련과 평가에 적합하다. 또한 공시 본문 텍스트와 회계 수치가 함께 제공되어, 문맥과 숫자를 결합한 하이브리드 추론 과제를 설계할 수 있으며, 한·미 시장 간 교차 검증 실험을 위한 표준화된 데이터 파이프라인을 제공한다.
实际应用
DartLab 데이터셋은 실무적 가치가 높아, 금융 기관, 투자 분석가, 데이터 기반 의사결정 과정에서 광범위하게 응용된다. 투자자는 데이터 센터를 통해 종목·항목을 선택, CSV·엑셀로 직접 다운로드하거나 구글시트에 실시간 연동하여 재무 건전성, 배당 이력, 지배구조 변화를 일목요연하게 모니터링할 수 있다. 터미널 기능은 단일 종목에 대한 종합 대시보드를 제공하여, 애널리스트가 리서치 레포트 작성 시 필요한 기업 정보를 빠르게 수집하도록 돕는다. 또한 공시 뷰어는 사업보고서 본문을 항목×기간 격자로 펼쳐 보여주어, 감사보고서상 핵심 사항이나 사업 위험 요인을 파악하는 데 유용하다. 리서치 메타 인덱스는 증권사 분석 자료의 존재를 알려주어, 시장 컨센서스와 공시 정보를 대조하는 작업을 간소화한다.
衍生相关工作
이 데이터셋을 기반으로 여러 후속 작업이 파생될 것으로 기대된다. 첫째, 재무제표 수치와 공시 텍스트를 결합한 사전 학습 언어 모델(예: FinBERT 계열)의 한국어·영어 혼합 훈련 데이터로 활용되어, 회계 전문 용어와 문맥적 수치 관계를 이해하는 도메인 특화 모델 개발을 촉진한다. 둘째, 한·미 시장 동형 표준화 특성을 활용한 교차 시장 전이 학습 연구가 활성화되어, 제도적 차이가 모델 성능에 미치는 영향을 분석하는 학술 논문이 생산될 수 있다. 셋째, 공시 원문과 XBRL을 연결한 구조는 회계 데이터 간 불일치 탐지, 공시 변경 감지 등의 감사 자동화 연구에 기여하며, 시계열 주가·거시지표 연계는 이벤트 스터디(Event Study) 및 포트폴리오 최적화 기법을 검증하는 벤치마크로 활용될 가능성이 높다.
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务