遇见数据集

opendata

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集来自 OpenData Consortium 数据平台,包含三个开放子数据集:companies 数据集包含约 1.03 亿家全球公司及其公司属性信息;locations 数据集包含约 2.73 亿个商业地点,附有地址和地理数据;people 数据集包含约 1.01 亿个与公司关联的商业联系人。所有数据均提供 Parquet(主要格式,gzip 压缩)、CSV(gzip 压缩,带表头)和 JSON(换行分隔,gzip 压缩)三种格式。适用于商业分析、地理空间分析、联系人管理等多种任务。

This dataset comes from the OpenData Consortium data platform and contains three open sub-datasets: the companies dataset includes approximately 103 million global companies and their company attribute information; the locations dataset includes approximately 273 million business locations with address and geographic data; the people dataset includes approximately 101 million business contacts associated with companies. All data is provided in three formats: Parquet (primary format, gzip compressed), CSV (gzip compressed, with headers), and JSON (newline-delimited, gzip compressed). It is suitable for various tasks such as business analysis, geospatial analysis, and contact management.

创建时间:
2026-08-20
原始信息汇总

OpenData Consortium 数据集概述

该数据集由 OpenData Foundation 发布,包含来自 OpenData Consortium 数据平台导出的三个开放数据子集,覆盖全球企业、商业地点和商业联系人信息。

数据集构成

子集配置名称 内容描述 数据规模 主要格式
companies 全球企业数据,包含企业特征属性(如规模、行业等) 约 1.03 亿条 Parquet
locations 商业地点数据,包含地址和地理信息 约 2.73 亿条 Parquet
people 与企业关联的商业联系人数据 约 1.01 亿条 Parquet

数据格式

每个实体均提供以下三种格式,存储于 data/{entity}/{format}/ 目录下:

  • Parquet:主要格式,gzip 压缩
  • CSV:gzip 压缩,包含表头行
  • JSON:换行分隔的 JSON,gzip 压缩

数据加载方式

可通过 Hugging Face datasets 库加载,示例代码如下:

python from datasets import load_dataset

companies = load_dataset("OpenDataFoundation/opendata", "companies") locations = load_dataset("OpenDataFoundation/opendata", "locations") people = load_dataset("OpenDataFoundation/opendata", "people")

数据文件结构

  • 每个配置(companieslocationspeople)对应一个训练集(train),数据文件为 Parquet 格式,路径位于各实体的 data/{entity}/parquet/ 目录下。
搜集汇总
数据集介绍
opendata 数据集图片
构建方式
该数据集源自OpenData Consortium数据平台,涵盖全球企业、商业地点及商务联系人三大实体,以Parquet格式为主,辅以CSV和JSON格式存储。每个实体均提供约1亿至2.7亿条记录,数据按配置子集划分,便于按需加载。构建过程中,数据经过清洗、去重及标准化处理,确保字段一致性及空间数据的准确性,同时采用gzip压缩技术以优化存储与传输效率。
特点
此数据集的核心优势在于其规模宏大且高度结构化,覆盖全球企业及其关联信息,为商业情报分析、市场趋势研究及地理空间应用提供了丰富素材。数据字段包含企业特征、地址地理位置及联系人归属,形成相互关联的数据网络。多格式支持显著提升了数据兼容性,便于不同工具链的集成。此外,数据集按企业、地点、人物三种维度独立配置,用户可灵活选择所需的子集,降低数据冗余。
使用方法
使用者可通过HuggingFace的datasets库便捷加载所需配置,例如使用load_dataset("OpenDataFoundation/opendata", "companies")获取企业数据。数据集支持分批次读取,适合大规模分布式处理。对于需要原始文件的操作,也可直接访问Parquet、CSV或JSON文件,依据gzip解码后用于数据工程管道或分析平台。建议根据研究目标选择对应的配置,并结合企业、地点或人物间的关联字段进行跨数据集整合分析。
背景与挑战
背景概述
OpenData Consortium数据集由OpenDataFoundation机构于近期发布,旨在提供全球范围内大规模的企业、地理位置及人物关联数据。该数据集包含约103万家公司的工商属性信息、2.73亿个商业地点的地址与地理空间数据,以及1.01亿个与企业关联的商业联系人记录,覆盖了商业智能、市场分析、供应链优化等多个研究领域。其核心研究问题在于构建一个统一、多实体关联的开放数据平台,以支持跨领域的数据挖掘与知识图谱构建。该数据集凭借其庞大的规模与多模态格式(Parquet、CSV、JSON),为学术界和工业界提供了宝贵的数据资源,对推动全球商业数据标准化和开放数据运动具有重要影响力。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两个层面。在领域问题层面,全球企业数据存在异构性、缺失值及动态变化,如何从海量异构数据中提取一致、准确的实体属性并保持实体间关联的完整性,是一个重大挑战。此外,数据规模巨大(总记录数超4.7亿),对存储、检索与计算效率提出了严苛要求。在构建过程中,数据清洗与去重需处理不同来源的格式差异与噪声,确保跨实体一致性的同时需应对隐私合规性问题(如联系人数据的匿名化)。数据更新机制的可持续性也是一大挑战,需在保证数据时效性的同时控制成本。这些挑战促使研究者在数据质量、分布式处理及隐私保护方面持续探索。
常用场景
经典使用场景
在商业智能与数据分析领域,OpenData Consortium 数据集为研究者和工程师提供了一个覆盖全球的实体知识库,包含约1.03亿家企业、2.73亿个商业地点及1.01亿条商业联系人记录。该数据集的经典使用场景集中于构建企业知识图谱、进行地理空间分析以及开展大规模社会网络研究。研究者可借助其丰富的公司属性、精确的位置坐标以及人员与企业的关联关系,开展商业模式挖掘、区域经济分析、人才流动趋势预测等前沿探索。其多格式支持(Parquet、CSV、JSON)和高效的加载接口,大大降低了数据预处理的门槛,使得快速原型验证与大规模实验成为可能,是数据驱动型商业研究的基石性资源。
实际应用
在实际应用中,该数据集广泛服务于市场营销、风险管理和城市治理等关键领域。例如,销售团队可利用企业和联系人数据构建精准的客户画像,优化潜在客户开发策略;金融机构能通过分析企业属性与关联网络,评估信用风险与供应链韧性;城市规划部门则可借助位置数据透视商业设施分布,为公共服务资源配置提供决策支持。同时,数据集的全球覆盖特性支持跨国企业进行市场进入策略研究,以及物流公司优化仓储与配送网络布局。其稳定的数据格式和便捷的云端加载方式,使得从数据到洞察的转化流程高效流畅,成为众多商业智能系统和企业数据中台的核心数据源之一。
衍生相关工作
该数据集的发布催生了一系列衍生研究与工具。在知识图谱领域,研究者以其为基础构建全球企业关联图谱,推动了实体链接与关系预测算法的进步;在自然语言处理中,企业名称与地址数据被用于训练地理编码和命名实体识别模型。此外,基于该数据集的图神经网络应用,如供应链风险传播模拟、区域经济聚类分析等,已成为热门研究方向。数据的高质量和覆盖度也使其成为各类机器学习基准测试的候选数据集,服务于企业破产预测、商业景气指数编制等任务。这些衍生工作不仅验证了数据集的多维度应用潜力,也促进了跨学科合作,持续拓展着数据驱动商业研究的前沿边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务