opendata
收藏资源简介:
该数据集来自 OpenData Consortium 数据平台,包含三个开放子数据集:companies 数据集包含约 1.03 亿家全球公司及其公司属性信息;locations 数据集包含约 2.73 亿个商业地点,附有地址和地理数据;people 数据集包含约 1.01 亿个与公司关联的商业联系人。所有数据均提供 Parquet(主要格式,gzip 压缩)、CSV(gzip 压缩,带表头)和 JSON(换行分隔,gzip 压缩)三种格式。适用于商业分析、地理空间分析、联系人管理等多种任务。
This dataset comes from the OpenData Consortium data platform and contains three open sub-datasets: the companies dataset includes approximately 103 million global companies and their company attribute information; the locations dataset includes approximately 273 million business locations with address and geographic data; the people dataset includes approximately 101 million business contacts associated with companies. All data is provided in three formats: Parquet (primary format, gzip compressed), CSV (gzip compressed, with headers), and JSON (newline-delimited, gzip compressed). It is suitable for various tasks such as business analysis, geospatial analysis, and contact management.
OpenData Consortium 数据集概述
该数据集由 OpenData Foundation 发布,包含来自 OpenData Consortium 数据平台导出的三个开放数据子集,覆盖全球企业、商业地点和商业联系人信息。
数据集构成
| 子集配置名称 | 内容描述 | 数据规模 | 主要格式 |
|---|---|---|---|
companies |
全球企业数据,包含企业特征属性(如规模、行业等) | 约 1.03 亿条 | Parquet |
locations |
商业地点数据,包含地址和地理信息 | 约 2.73 亿条 | Parquet |
people |
与企业关联的商业联系人数据 | 约 1.01 亿条 | Parquet |
数据格式
每个实体均提供以下三种格式,存储于 data/{entity}/{format}/ 目录下:
- Parquet:主要格式,gzip 压缩
- CSV:gzip 压缩,包含表头行
- JSON:换行分隔的 JSON,gzip 压缩
数据加载方式
可通过 Hugging Face datasets 库加载,示例代码如下:
python from datasets import load_dataset
companies = load_dataset("OpenDataFoundation/opendata", "companies") locations = load_dataset("OpenDataFoundation/opendata", "locations") people = load_dataset("OpenDataFoundation/opendata", "people")
数据文件结构
- 每个配置(
companies、locations、people)对应一个训练集(train),数据文件为 Parquet 格式,路径位于各实体的data/{entity}/parquet/目录下。




