hetus-time-use
收藏资源简介:
HETUS Harmonized Time Use数据集是从Eurostat HETUS TSV文件转换而来的标准化表格数据,包含扁平化的SDMX ESMS元数据。数据集旨在通过保留原始TSV标记和提供标准化分析字段,支持跨国家、年份、人口统计层和活动代码的时间使用比较分析。数据集包含三个主要部分:'observations'(长格式观测数据)、'files'(源文件转换和验证报告)和'metadata'(扁平化的SDMX ESMS元数据属性)。转换过程严格保持数据完整性,确保原始数据的无损映射。数据集适用于需要原始数据来源的可重复ETL流程和时间使用分析研究,但不适用于个体级推断。
The HETUS Harmonized Time Use Dataset is standardized tabular data converted from Eurostat HETUS TSV files, incorporating flattened SDMX ESMS metadata. This dataset aims to support cross-national, cross-year, cross-demographic-stratum and cross-activity-code comparative time use analyses by preserving original TSV markup and providing standardized analytical fields. The dataset consists of three core components: 'observations' (long-form observational data), 'files' (source file conversion and validation reports), and 'metadata' (flattened SDMX ESMS metadata attributes). The conversion process strictly maintains data integrity, ensuring lossless mapping of the original source data. This dataset is applicable to reproducible ETL workflows and time use analysis studies that require traceable original data sources, but is not intended for individual-level inference.
数据集概述:HETUS Harmonized Time Use (Eurostat TSV + ESMS metadata)
基本信息
- 数据集名称:HETUS Harmonized Time Use (Eurostat TSV + ESMS metadata)
- 许可证:CC BY 4.0
- 任务类别:表格分类、文本分类
- 语言:英语
- 标签:社会学、时间利用、欧洲、欧盟
- 数据规模:1M < n < 10M
数据来源与内容
- 原始来源:Eurostat HETUS 数据库导出文件(TSV 格式 + SDMX XML 元数据)
- 包含的波次:
2000_2010、2020 - 核心内容:从 Eurostat HETUS TSV 文件转换而来的规范化表格观测数据,以及扁平化的 SDMX ESMS 元数据。
数据结构与配置
数据集包含三个配置(config),均仅包含训练集(train split)。
1. 配置:files
- 描述:每个源文件的转换和验证报告。
- 特征:
wave、dataset_id、source_file、metadata_file、rows_wide、rows_long、rows_expected_long、lossless_validated、dimensions、time_periods_raw、time_periods。 - 数据量:39 个样本,8,186 字节。
- 下载大小:7,294 字节。
- 数据集大小:8,186 字节。
2. 配置:metadata
- 描述:扁平化的 SDMX ESMS 元数据属性。
- 特征:
wave、metadata_file、prepared_at、metadata_set_id、attribute_id、attribute_path、value_html、value_text。 - 数据量:150 个样本,94,561 字节。
- 下载大小:34,933 字节。
- 数据集大小:94,561 字节。
3. 配置:observations
- 描述:长格式的观测数据。
- 特征:
- 核心溯源字段:
dataset_id、wave、source_file、metadata_file、source_row_index、source_key_raw、dimension_order_raw、dimension_order、time_period_raw。 - 规范化字段:
time_period、time_period_year、observation_cell_raw、observation_raw、observation、observation_value、duration_minutes、status_flag、is_missing。 - 维度字段:
acl00、acl18、age、daysweek、freq、geo、hhcomp、hhstatus、isced11、isced97、month、sex、startime、tra_mode、unit、wstatus。
- 核心溯源字段:
- 数据量:1,680,915 个样本,636,505,250 字节。
- 下载大小:25,062,037 字节。
- 数据集大小:636,505,250 字节。
转换方法与数据完整性
- 转换工具:
db-hf-normalization.py - 关键步骤:
- 将 TSV 文件读取为原始文本。
- 展开第一列中的打包维度键。
- 将年份/时间列转换为长格式。
- 保留原始源标记以供审计。
- 完整性保证:
- 强制执行精确的行基数:
rows_long == rows_wide * number_of_time_period_columns。 - 在单元格级别保留原始源元组:
(source_row_index, source_key_raw, time_period_raw, observation_cell_raw)。 - 若检测到不匹配,该文件的转换将失败。
- 强制执行精确的行基数:
已知注意事项
- 第一个 TSV 列存储用逗号分隔的打包维度。转换器同时保留原始打包键和扩展后的规范化维度。
- 分析列中的值周围的空格可能会被规范化,但原始字段保持不变。
预期用途
- 跨国家、年份、人口统计层和活动代码的比较性时间利用分析。
- 需要原始源数据谱系的可复现 ETL 流程。
非预期用途
- 任何个体层面的推断(本数据集为汇总表格统计)。
引用要求
使用时请引用 Eurostat HETUS,并包含此转换数据集的仓库/版本信息。




