遇见数据集

open-data-catalogue

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

Open Data catalogue 是一个开放数据元数据目录数据集,包含两个主要部分:发现目录和可用性索引。发现目录收录了来自 ISTAT、Eurostat、OECD、ILO、DoveVannoINostriSoldi (DVNS) 和 Cruscotto Italia 等统计机构共计 15990 个数据集条目,每条记录包含提供者、数据集ID、标题、是否活跃、是否提供服务、是否可搜索、许可证以及完整的原始JSON记录。可用性索引提供了 72482 个跨 26 个数据集的已验证组合(包括时期、地区、度量、维度等维度),每个组合标识了观察值的存在性(observed/missing/suppressed),并带有证据过期时间戳。该数据集不包含任何观测数值,仅作为元数据索引。数据集通过三个子集(catalogue、availability_datasets、availability_combinations)以 JSONL 格式提供,适用于开放数据目录的检索、可用性验证和元数据整合分析。语言支持意大利语和英语。许可证遵循各原始数据集的单独条款,Gramscii 的汇编部分以 CC BY 4.0 授权。

The Open Data catalogue is an open data metadata directory dataset consisting of two main parts: a discovery catalogue and an availability index. The discovery catalogue contains 15,990 dataset entries from statistical agencies such as ISTAT, Eurostat, OECD, ILO, DoveVannoINostriSoldi (DVNS), and Cruscotto Italia. Each entry includes provider, dataset ID, title, active status, service status, searchability, license, and the full raw JSON record. The availability index provides 72,482 verified combinations across 26 datasets (including dimensions such as period, region, measure, dimension, etc.), each indicating the existence of observations (observed/missing/suppressed) with an evidence expiry timestamp. This dataset contains no actual observation values and serves only as a metadata index. It is provided in JSONL format via three subsets (catalogue, availability_datasets, availability_combinations), suitable for open data catalog retrieval, availability validation, and metadata integration analysis. Languages supported: Italian and English. License follows the individual terms of each original dataset; Gramsciis compilation is licensed under CC BY 4.0.

创建时间:
2026-09-08
原始信息汇总

Open Data catalogue 数据集详情

数据集概述

  • 名称: Open Data catalogue
  • 语言: 意大利语(it)、英语(en)
  • 许可证: 其他(per-dataset),具体许可条款因数据集而异
  • 标签: open-data、sdmx、statistics、availability
  • 主要发布内容:
    • 独立版本化的元数据
    • 授权来源的快照(snapshots)
    • 不包含观测值(observation values)

数据规模与来源

  • 发现目录: 包含来自 ISTAT(意大利国家统计局)、Eurostat、OECD、ILO、DoveVannoINostriSoldi (DVNS) 和 Cruscotto Italia 的 15,990 条数据集条目
  • 已验证可用性索引: 涵盖 29 个数据集 中的 888,000 个联合组合(基于明确声明范围内完整的源响应构建)
  • 快照信息: 快照时间为 2026-09-09T16:41:28.627318+00:00
  • 已完成的索引分区: 189,575 个分区

数据配置

共有三个配置,各自包含 data 分割:

配置名称 说明 主要字段
catalogue 所有发现条目 provider、dataset_id、title、active、served、searchable、licence、record_json
availability_datasets 索引数据集范围及证据到期信息 provider、dataset_id、title、verified_at、valid_until、definition_sha256、scope_json、axes_json、partitions_json
availability_combinations 所有索引元组 provider、dataset_id、period、period_start、period_end、territory_code、territory_label、territory_level、measure_code、measure_label、unit_code、unit_label、dimensions_json、presence、partition

已验证可用性概览

部分已验证数据集详情(来源、期间、地区数量及组合数)如下:

Provider 数据集 组合数量
dvns eurostat_cofog 8,228
dvns opencivitas_fabbisogni_2018/2019/2021/2022 45,899 - 46,242
cruscotto demografia 63,168
cruscotto istruzione_profilo 15,792
cruscotto lavoro_profilo 23,688
cruscotto redditi_mef 23,688
cruscotto scuole_miur 6,968
cruscotto contratti_anac 未指明(存在大量分钟级来源快照)

重要说明

  • 可用性索引为现有来源数据集提供存在性证明,其组合不构成新增数据集
  • 元数据以 JSON 文本形式保留,以保证不同提供方字段不影响表格结构
  • 目录条目保留完整原始行于 record_json 字段中
  • 数据中不包含搜索向量或凭据信息
  • 数据完整性校验信息见 viewer-manifest.json
搜集汇总
数据集介绍
open-data-catalogue 数据集图片
构建方式
该数据集以开放数据生态为基点,系统性地整合了来自ISTAT、Eurostat、OECD、ILO、DoveVannoINostriSoldi及Cruscotto Italia等多源权威统计机构的数据集元数据。其构建过程遵循独立版本化与溯源原则,通过发现目录收录15990条数据集条目,并基于完整源响应构建了包含888000个联合组合的可用性索引。针对不同来源的异构字段,采用JSON文本保留嵌套元数据以维持表结构一致性,同时将原始记录完整存于record_json字段,实现元数据与源快照的清晰分层管理。
使用方法
使用者可通过HuggingFace平台加载三个预配置的子集:catalogue(发现目录)、availability_datasets(数据集范围与过期信息)及availability_combinations(全部组合索引)。每个子集均拥有独立的data分割,方便直接调用。数据集并非用于模型训练,而是作为元数据参考,支持研究者验证开放数据的可用性、追踪其存续状态,或构建数据发现服务。通过record_json字段可回溯原始记录,结合验证时间戳判断数据新鲜度,适用于数据治理、统计监测与跨机构数据协调等应用场景。
背景与挑战
背景概述
Open Data catalogue 数据集由 Gramscii-IT 主导创建,于 2026 年发布,旨在系统性地整合来自 ISTAT、Eurostat、OECD、ILO 等权威机构及意大利本土数据源的开放数据元数据。该数据集的核心研究问题是构建一个包含 15,990 条数据集记录及 888,000 个已验证联合组合的可用性索引,以解决开放数据发现与可用性验证的碎片化问题。其独特性在于从完整源响应中提取经验证据,而非简单聚合观测值,为开放数据生态的透明性和可复现性提供了元数据基准。该数据集对开放数据治理、统计互操作性及数据质量评估等领域具有重要影响,通过提供分版本化的元数据和独立许可的源快照,促进了跨机构、跨领域的数据集成研究。
当前挑战
该数据集面对的领域挑战主要源于开放数据生态的异构性:不同提供方(如 ISTAT、Eurostat)采用差异化的 SDMX 标准和元数据模式,导致数据发现耗时且可用性难以验证。为应对此,数据集在构建过程中面临多重技术障碍,包括统一异构源的时间、地域与度量维度,设计可扩展的 JSON 模式以保留嵌套元数据,以及实现 189,575 个分区的高效索引与 88.8 万联合组合的验证。此外,需确保源快照的许可合规与版本独立性,同时避免引入搜索向量或凭据,在数据完整性与隐私保护间取得平衡。这些挑战要求构建精细化的证据过期机制,以维护索引的长期可信度。
常用场景
经典使用场景
Open Data catalogue数据集作为开放数据生态系统的核心索引,广泛应用于数据发现、数据溯源与数据可用性评估等领域。其包含来自ISTAT、Eurostat、OECD等权威机构的15990条数据集条目,为研究者提供了一个统一的多源元数据视图。该数据集最经典的使用场景是构建跨机构数据发现平台,支持基于标题、提供方等字段的检索与筛选,实现开放数据的高效定位。此外,其详尽的可用性索引信息,包括数据集的活跃状态、服务状态及许可证类型,为数据的合规使用提供了必要依据,是数据治理与开放数据联盟研究的理想基准。
解决学术问题
该数据集解决了开放数据领域长期存在的多源异构元数据标准化与可用性证据缺失问题。具体而言,它提供了包含888,000个联合组合的已验证可用性索引,基于完整的源响应构建,确保数据的存在性可验证。这为学术研究中关于数据质量评估、数据生命周期管理的课题提供了实证基础。其贡献在于将碎片化的公开数据目录整合为结构化、带时效性标记的索引,有效支撑了对数据可用性动态变化的研究,并为数据完整性验证、数据缓存策略优化等理论提供了可靠的数据支持,推动开放数据科学走向更严谨的实证范式。
实际应用
在实践层面,该数据集为政府数据开放门户优化、公共政策制定及公民数据素养提升提供了工具。其可用性索引帮助数据管理人员快速识别并修复失效的数据链接,保障公民对政府数据的持续访问。同时,数据集涵盖了人口、教育、就业、收入、学校及公共合同等关键民生领域,可直接服务于社会经济分析应用,例如地方财政透明度监测、劳动力市场趋势追踪。此外,其开放的元数据格式与版本化存储结构,便于开发者集成至数据监测仪表板或SDMX标准兼容的统计工具中,实现开放数据的自动化监控与实时展示,增强公共数据的实用价值。
数据集最近研究
最新研究方向
该数据集聚焦于开放数据生态系统中元数据与数据可用性验证的前沿探索,尤其在多源异构统计数据的整合与溯源方面展现出显著创新。其核心研究方向在于构建一个跨机构、跨地域的开放数据目录及可用性索引,通过精细化的分区索引与版本化快照,实现对ISTAT、Eurostat等权威来源数据的高效发现与实时状态监控。这一工作呼应了当前对数据质量、透明度和可复现性的迫切需求,为大数据分析、政策制定及社会科学研究提供了坚实的数据基础设施。特别地,对意大利及欧洲地区财政、人口等关键领域的覆盖,使得该数据集成为评估区域发展动态的重要参考,推动了基于证据的决策支持系统向更精确、更可信的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务