遇见数据集

sentier-inventory

收藏
github2026-06-08 更新2026-06-10 收录
官方服务:

资源简介:

Sentier平台的标准化生命周期清单数据集,包含过程和交换数据,按行业/数据类型(如农业、电力等)分区存储为parquet格式。

The standardized life cycle inventory dataset on the Sentier Platform contains process and exchange data, which is partitioned by industry/data type (e.g., agriculture, power generation, etc.) and stored in Parquet format.

创建时间:
2026-06-08
原始信息汇总

数据集概述:sentier-inventory

目标与定位
为 Sentier 平台提供标准化的生命周期清单(LCI)数据集,包含流程及其交换数据。属于数据层仓库,仅存储可加载的构建产物,不含抓取、解析或计算代码。

数据流向

  • 输入:由 sentier-importers(通过 PR/Push 提交)和 sentier-models 提供。
  • 输出:由 sentier-platform 读取(获取 LCI 矩阵)。
  • 跨源链接(技术圈、基本流)通过 sentier-mappings 解析。

目录结构

  • schema/:包含 YAML 列定义和元数据的 JSON Schema。
  • data/:按行业/数据类型分列的原始 Parquet 文件(带排名前缀)。

数据组织
按行业/数据类型分类(如 agriculture、electricity 等)。每个 data/<NN>-<sector>/ 文件夹包含:

文件 内容
processes.parquet 每个流程(活动/节点)一行
exchanges.parquet 每个交换(技术圈+生物圈边)一行
metadata.json 行业标识(行业、标题、排名、行数)

NN 排名前缀决定行业顺序和解析优先级(数值越小优先级越高)。Parquet 数据由应用层推送,骨架仅包含文件夹结构、模式和 metadata.json 存根。

数据模式
使用纯 YAML 表定义(schema/process.yamlschema/exchange.yaml,共享枚举位于 schema/common.yaml)。模式直接描述 Parquet 列,不依赖 LinkML(LinkML 仅用于 sentier-vocab)。这些文件作为数据合约,sentier-importers 依赖它们验证和转换输入数据。本仓库不包含 Python 包、加载器或测试代码。

许可协议
MIT 许可,默认开放且可客户端加载。

搜集汇总
数据集介绍
sentier-inventory 数据集图片
构建方式
在生命周期评价(LCA)领域,标准化数据层对于确保不同来源过程清单的可互操作性至关重要。sentier-inventory数据集作为Sentier平台的核心数据层,专为存储标准化的生命周期清单而设计,其构建方式遵循严格的分层架构。数据集通过`sentier-importers`和`sentier-models`持续注入数据,所有跨来源链接(包括技术圈和基本流)均经由`sentier-mappings`解析实现关联。数据按行业或数据类型组织的规则分区,每个子文件夹(如`data/<NN>-<sector>/`)包含三个核心Parquet文件——`processes.parquet`记录每个过程活动节点,`exchanges.parquet`存储所有技术圈和生物圈边界流,而`metadata.json`则维护行业标识、标题、优先级排名和行计数等元信息。行列定义由纯YAML模式文件(如`schema/process.yaml`)严格约定,作为数据格式的契约,不包含任何代码逻辑。
特点
该数据集的卓越特点在于其精细的预定义架构与高度解耦的模块化设计。采用数值前缀`NN`对行业进行优先级排名,较低数值表示更高分辨率,从而支持模糊解析时的冲突解决机制。值得注意的是,数据集本身仅承载结构化工件——仅包含文件夹骨架、模式定义和元数据存根,所有实际Parquet负载由应用层推送,严格分离了数据层与计算逻辑。`schema/`目录中的YAML文件作为列定义和JSON Schema验证的直接描述,避免了LinkML的复杂性,专注于Parquet列的严格类型规范化。数据不记录上游来源细节,导入日志完全委托给`sentier-importers`,确保了本仓库的纯净性和可维护性。
使用方法
使用该数据集需要依托Sentier平台的整体生态系统,其读取接口由`sentier-platform`通过HTTP GET请求获取LCI矩阵。用户无需直接操作本仓库中的代码,因为该仓库不包含Python包、加载器或测试程序——所有摄取逻辑都封装在`sentier-importers`中,而读取侧逻辑则归入`sentier-platform`。在实际应用中,开发者需通过`sentier-importers`将原始数据验证并转换为标准Parquet格式后推送到本仓库,再在更大平台中调用`sentier-platform`来检索已解析的矩阵。数据集采用MIT开源许可,默认开放加载,但用户需熟悉Parquet文件格式及YAML模式定义,方能正确解析`processes.parquet`和`exchanges.parquet`中的复杂列结构。
背景与挑战
背景概述
生命周期评估(LCA)作为量化产品与服务全生命周期环境影响的标准化方法,其核心在于高精度、可互操作的清单数据集。然而,传统LCA数据分散于各类专有数据库,格式迥异且缺乏统一关联。为解决这一困境,Sentier项目应运而生。Sentier Inventory数据集创建于近年,由Sentier开源社区主导开发,旨在打造一套标准化、可跨源链接的生命周期清单数据集,涵盖农业、电力等典型行业。该数据集通过统一的数据结构(Parquet文件)和YAML模式定义,将过程与交换数据组织为可机器读取的资产,服务于Sentier平台的矩阵计算。其核心创新在于引入排序前缀实现领域优先级解析,并通过跨源映射解决技术圈与基本流的一致性问题。作为Sentier生态的数据核心层,该数据集为推动LCA工具的开源协作和科学数据共享提供了关键基础设施,在工业生态学与可持续计算领域具备深远影响力。
当前挑战
该数据集面临双重挑战。首先,在领域问题层面,LCA数据的异构性与互操作性不足长期制约着环境影响评估的精确性与可复现性。不同数据库间的过程定义、流命名及分配方法存在显著差异,导致数据融合时极易出现语义冲突与量化偏差。Sentier Inventory虽通过标准化模式与跨源映射进行缓解,但如何自动化解译并消解多源数据间的不一致性,仍是核心难题。其次,在构建过程中,数据集面临供应链完整性挑战:需从各类emergent数据源导入原始清单,但上游数据质量参差不齐、缺失值频发,且元数据溯源信息未被纳入本仓库——导入日志独立存储于sentier-importers中,这增加了数据偏差追溯与版本管理的复杂度。此外,如何在不引入计算逻辑的前提下,仅通过目录排序与合同式模式保障数据的结构性自洽,也对架构设计提出了严苛的约束条件。
常用场景
经典使用场景
在生命周期评价(LCA)这一日益重要的可持续发展研究领域中,sentier-inventory数据集的核心使命是为环境足迹量化提供标准化、可复用的过程清单数据。该数据集以归因式生命周期清单(LCI)为骨架,系统性地组织了一系列工业过程和其对应的物质交换关系,覆盖农业、电力等关键行业板块。研究者通常从该数据集中提取特定行业的过程节点及其技术圈与生物圈的交换边,构建投入产出矩阵,以分析产品或服务在整个生命周期中的资源消耗与排放特征。这种标准化的数据编排方式消除了不同来源数据之间的结构与语义异质性,使得跨行业、跨地域的比较性LCA研究成为可能,是推动生命周期思维从学术实验室走向标准化工具的关键基础设施。
解决学术问题
该数据集直面了生命周期评价领域中数据碎片化、格式不统一与溯源困难的长期学术痛点。通过将过程、交换和元数据以Parquet列式格式进行规范化存储,并辅以YAML定义的列字段约束,它从根本上解决了传统LCI数据集在互操作性上的障碍。研究团队得以摆脱繁琐的数据清洗与格式转换环节,将精力聚焦于模型算法与影响评价方法学的创新。更重要的是,数据集设计的交叉源链接映射机制(经由sentier-mappings解析技术圈与基本流间的关联)有效缓解了不同数据库间本体与命名体系的冲突,为建立全球统一的生命周期清单本体提供了实践范本。此举显著降低了生命周期建模的入门门槛,对加速建筑、能源和交通等领域的低碳转型研究具有深远的学术催化效应。
衍生相关工作
围绕sentier-inventory数据集,衍生出了一系列推动LCA自动化的关键工具与工作流。其中,sentier-importers作为数据摄入管道,利用该仓库的YAML模式契约对原始数据进行校验与类型强制转换,构建起从多种工业数据库到标准化Parquet文件的桥接机制;sentier-mappings项目则专门负责解析不同数据源间的技术圈与基本流映射关系,使得跨库环境影响计算成为可能。在模型层面,sentier-models利用该清单库构建动态参数化的生命周期模型,实现了从静态清单到情景驱动分析的跃迁。此外,sentier-platform中的LCI矩阵运算核心直接读取本仓库的Parquet负载,提供了可复现的背景系统矩阵生成服务,这些衍生项目共同编织了一个从数据存储、语义对齐到在线计算的完整生命周期评价生态体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务