遇见数据集

global-lei-company-registry-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

Global LEI Company Registry (GLEIF) 数据集是基于 GLEIF 黄金副本构建的分析就绪表,收录了约340万个法律实体的注册地址、企业层级关系及报告异常信息。该数据集由 DataForge 开放数据计划提供,适用于学术和个人免费使用。数据以多个分片包的形式发布,包括S(起始切片,72万实体)、M(研究包,678万行,含二级关系)和L(完整黄金副本,1359万行,含实体、关系及报告异常)。数据集包含六个配置:companies(公司)、country_summary(国家摘要)、crosswalk(交叉引用)、groups(集团)、ownership_edges(所有权边)和reporting_exceptions(报告异常)。数据格式为Parquet,每包附带数据字典、数据表和质量报告。典型用途包括实体解析、KYC参考数据、企业层级映射、将LEI与申报文件、交易和注册信息关联,以及市场结构研究。底层数据遵循CC0 1.0许可,DataForge策展层采用CC BY-NC 4.0许可(学术/个人使用需署名并链接回data.zalize.com),商业使用需获得DataForge商业许可。

The Global LEI Company Registry (GLEIF) dataset is an analysis-ready table built from the GLEIF Golden Copy, containing approximately 3.4 million legal entities registered addresses, corporate hierarchy relationships, and reporting exception information. It is provided by the DataForge Open Data Program and is free for academic and personal use. The data is published in multiple shard packages: S (starting slice, 720,000 entities), M (research package, 6.78 million rows with second-level relationships), and L (full Golden Copy, 13.59 million rows with entities, relationships, and reporting exceptions). The dataset includes six configurations: companies, country_summary, crosswalk, groups, ownership_edges, and reporting_exceptions. Data format is Parquet, each package comes with a data dictionary, data table, and quality report. Typical uses include entity resolution, KYC reference data, corporate hierarchy mapping, linking LEI to filings, transactions, and registration information, as well as market structure research. The underlying data follows CC0 1.0 license, and the DataForge curation layer uses CC BY-NC 4.0 license (academic/personal use requires attribution and link back to data.zalize.com), commercial use requires a DataForge commercial license.

创建时间:
2026-08-08
原始信息汇总

数据集概述

Global LEI Company Registry (GLEIF) 是一个完整的全球法律实体标识符(LEI)金标准副本数据集,以分析就绪的表格形式呈现,包含340万个法律实体及其注册地址、公司层级关系和报告例外情况。

基本信息

  • 许可协议:CC BY-NC 4.0(非商业用途);商业用途需另行获取DataForge商业许可
  • 语言:英文(en)
  • 任务类别:表格分类(tabular-classification)
  • 数据规模:10M < n < 100M 行
  • 数据来源:GLEIF金标准副本(上游数据为CC0 1.0许可)

数据集内容

数据集包含以下6个配置(configs):

配置名称 说明
companies 公司实体数据
country_summary 国家汇总数据
crosswalk 交叉引用数据
ownership_edges 股权关系边数据
groups 集团数据
reporting_exceptions 报告例外数据

数据包分类

数据集提供三个层级的数据包:

数据包 层级 行数 大小
gleif-tier1-S-2026-08-04.zip S(入门版) 719,985 86.9 MB
gleif-tier1-M-2026-08-04.zip M(研究版) 6,788,250 853.5 MB
gleif-tier2-L-2026-08-04.zip L(完整版) 13,589,679 1.00 GB
  • S(入门版):包含72万实体
  • M(研究版):包含680万行,涵盖二级关系
  • L(完整版):包含实体、关系和报告例外的完整金标准副本
  • 每个数据包均附带数据字典、数据表和QA报告

应用场景

  • 实体解析和KYC参考数据
  • 公司层级映射
  • 将LEI与申报文件、交易和注册信息进行关联
  • 市场结构研究

使用方法

python from datasets import load_dataset

ds = load_dataset("zalizedata/global-lei-company-registry-dataset", "companies", split="train") print(ds[0])

引用信息

text DataForge (data.zalize.com), built from GLEIF CC0 golden-copy data — https://data.zalize.com/datasets/global-lei-company-registry-dataset

DOI(Zenodo镜像):10.5281/zenodo.21837354

搜集汇总
数据集介绍
global-lei-company-registry-dataset 数据集图片
构建方式
本数据集源自全球法人机构识别编码基金会(GLEIF)发布的黄金副本,经DataForge开放数据计划精心整理,转化为可直接分析的表格式数据。构建过程涵盖对3.4百万法人实体及其注册地址、公司层级关系及报告异常等信息的系统整合,并划分出S、M、L三个层级的数据包,分别提供不同规模的样本,以满足从初步探索到全面研究的多元需求。每一层级均附有详尽的数据字典、数据表及质量评估报告,确保数据的完整性与可追溯性。
特点
该数据集的核心特征在于其全面性与精细度,不仅囊括了法人实体的静态注册信息,更深入刻画了企业间的所有权关系网络,为解析复杂公司结构提供了宝贵资源。数据以六种配置形式(companies、country_summary、crosswalk、groups、ownership_edges、reporting_exceptions)呈现,便于用户按需提取特定维度的信息。此外,数据集采纳CC BY-NC 4.0许可,适用于学术与个人研究,其上游数据源自CC0 1.0的GLEIF黄金副本,保证了数据的权威性与合法使用。
使用方法
使用该数据集极为便捷,用户可通过HuggingFace的datasets库直接加载,例如执行`load_dataset("zalizedata/global-lei-company-registry-dataset", "companies", split="train")`即可获取公司主体信息。数据集的多种配置支持多样化的分析场景,如实体解析、KYC参考数据、企业层级图谱构建,以及将LEI与备案、交易、注册记录进行关联研究。同时,提供的S、M、L三种数据包分别对应不同数据量级,灵活适配从小规模测试到大规模数据挖掘的各类任务,且每包均包含数据字典和QA报告,便于快速上手与质量校验。
背景与挑战
背景概述
该数据集由DataForge开放数据计划于2026年构建,基于GLEIF(全球法人机构识别编码基金会)的黄金副本数据,旨在提供全球法人机构的标准化注册信息。涵盖约340万个法律实体,包含注册地址、公司层级关系及报告异常等关键字段,以分析就绪的表格形式呈现。作为开源数据倡议的一部分,该数据集由Zalize团队整合,遵循CC BY-NC 4.0许可,为非商业研究与个人使用提供了便利。其核心研究问题聚焦于实体解析、KYC(了解你的客户)参考数据、公司层级映射以及市场结构分析,为金融监管、供应链尽职调查等领域提供了关键的基础数据支撑,推动了全球公司治理和透明度的发展。
当前挑战
该数据集所应对的挑战包括:首先,全球公司注册信息分散于众多司法管辖区,缺乏统一标识,导致实体识别与关联困难,该数据集通过LEI标准予以解决;其次,公司层级关系复杂且动态变化,准确构建所有权图谱需持续更新与校验,数据集为此准备了层级关系表;再者,数据构建过程中面临跨源数据整合、字段一致性处理及大规模数据清洗等难题,需在确保数据质量的同时控制存储与处理成本,数据集通过分级打包(S/M/L)提供灵活配置,以适应不同规模的研究需求。
常用场景
经典使用场景
该数据集作为全球法人机构识别编码(LEI)的黄金副本,以分析就绪的表格形式收录了逾340万法人实体的注册地址、公司层级关系及报告例外信息,为学术界提供了一套标准化、可机读的全球企业注册基础数据。其经典使用场景集中在实体解析与KYC参考数据构建,研究者可依据LEI这一全球唯一标识符,高效关联不同来源的公开数据,实现企业身份的精准匹配与去重。此外,数据集内置的国家汇总、交叉索引及所有权边表,为跨地域、跨市场的企业网络分析提供了坚实的数据底座,尤其适用于金融监管科技与公司治理领域的实证研究。
解决学术问题
该数据集的发布有效解决了长期困扰学术界的全球企业数据碎片化与标识不一致问题。通过提供统一、全覆盖的LEI映射框架,它显著降低了多源数据融合时的实体对齐成本,为金融风险传染、供应链网络韧性、跨国投资结构等研究提供了可靠的分析基础。同时,其精细的公司层级关系和报告例外信息,使得学者能够深入探究企业所有权结构的复杂性,以及监管合规的异质性表现,从而推动对公司治理、市场结构与系统性风险等经典议题的量化研究,其意义在于构建了连接微观企业行为与宏观金融现象的关键数据桥梁。
衍生相关工作
基于此数据集,一系列衍生性工作得以蓬勃展开,其影响力已辐射至多个前沿研究领域。在实证金融领域,学者利用其公司层级信息构建企业网络模型,揭示所有权关联在信贷风险传导和股价联动中的作用机制。在数据科学社区,该数据集成为知识图谱构建、图神经网络链接预测及实体对齐算法的标准测试平台,催生了大量开源工具与基准模型。此外,其与国家统计、贸易海关等多源数据集的交叉引用,为区域经济发展、产业集聚及全球价值链分解等经济地理议题提供了创新性的数据解决方案,衍生工作不仅验证了数据的内在价值,更不断拓展其应用边界,形成了一个活跃的学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务