遇见数据集

electricsheepasia/asia-ilo-ged-phow-sex-hht-geo-nb-mean-weekly-hours-actually-worked-of-prime-age-emp

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲20个国家在2000年至2025年间,主要年龄就业人员按性别、家庭类型和城乡区域划分的实际平均每周工作小时数的8,142个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了1个具体指标(GED_PHOW_SEX_HHT_GEO_NB),用于统计和分析劳动市场中的工作时间趋势。数据集以表格形式呈现,包括国家代码、年份、性别分类、观测值等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 8,142 observations of mean weekly hours actually worked of prime-age employed persons by sex, household type and rural/urban areas across 20 Asia countries, spanning from 2000 to 2025. It covers one distinct indicator (GED_PHOW_SEX_HHT_GEO_NB) sourced from the International Labour Organizations (ILO) ILOSTAT database, focusing on labor statistics related to hours of work. The data is presented in a tabular format with columns for country codes, years, sex disaggregation, observed values, and more, suitable for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ged-phow-sex-hht-geo-nb-mean-weekly-hours-actually-worked-of-prime-age-emp 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,该数据库整合了各国劳动力调查、家庭收入调查及行政记录等多元数据源,并依据国际劳工统计学家会议(ICLS)定义进行统一协调处理。Electric Sheep Asia团队通过ILOSTAT REST API直接提取了指标代码为GED_PHOW_SEX_HHT_GEO_NB的原始数据,并依据亚洲ISO3国家代码进行地域筛选,最终构建出涵盖20个亚洲国家、横跨2000年至2025年、共计8,142条观测值的数据集。每条记录均保留了原始数据中的性别、家庭类型及城乡地域等分类维度,并附带了数据来源标签以保障可追溯性。
特点
该数据集聚焦于亚洲地区主要就业人口每周实际工作时长的均值,其独特之处在于提供了性别(男性、女性、总计)、家庭类型(综合总计)及城乡地域(国家层面)三重维度的精细分解。数据以年度频率呈现,并采用了ILO官方选定的'最佳来源'策略,确保每个国家-年份组合下数据的权威性与一致性。此外,数据集还包含了观测值状态标记(如临时性、不可靠性),为用户提供了数据质量评估的依据。整体而言,该数据集是研究亚洲劳动力市场工时趋势与结构性差异的珍贵时间序列资源。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,只需调用`load_dataset`函数即可将数据转换为Pandas DataFrame进行后续分析。典型应用场景包括:依据国家代码(如`ref_area`列中的ISO3代码)筛选特定国家的数据以进行国别研究;基于`indicator`列选择单一指标并按时间排序,绘制时序图以观察趋势变化;利用`pivot_table`方法构建以年份为行、国家为列的透视矩阵,便于进行跨国比较。数据集已预先处理为Parquet格式,无需额外数据清洗即可直接用于机器学习建模或统计分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Asia重新封装后托管于HuggingFace平台,旨在提供亚洲地区20个国家2000至2025年间壮年就业人口按性别、家庭类型及城乡区域划分的周均实际工作小时数据。作为ILOSTAT核心统计数据库的衍生资源,该数据集整合了各国劳动力调查、家庭收入调查及行政记录等多源微观数据,并遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。其核心研究问题聚焦于揭示亚洲劳动力市场中的工时模式差异及其与人口结构、地域特征的关联,为劳动经济学、时间利用研究及可持续发展目标(SDG)中体面劳动指标的监测提供了关键实证基础。该数据集的发布显著提升了亚洲区域工时数据的可获取性与可比较性,尤其服务于跨国时间序列分析、性别劳动参与差异评估及政策影响建模等研究场景。
当前挑战
该数据集面临的核心挑战涵盖多重维度。在领域问题层面,工时数据的跨国比较长期受限于各国调查口径、季节调整方法及抽样误差的异质性,例如ILOSTAT虽采用统一指标定义,但不同国家来源数据(如劳动力调查与行政记录)的“最佳来源”选择可能导致时序断裂,而观测状态标记(如“不可靠”)进一步加剧了数据质量不确定性。在构建过程中,数据整合需应对多重碎片化难题:从ILOSTAT REST API抽取的原始数据包含20个亚洲国家的8142条记录,但国家间覆盖年限(如2000-2020年与2018-2024年差异)与缺失值模式存在显著不平衡;分类维度(性别、家庭类型、地域)的非完全填充要求算法处理稀疏矩阵,而年度频率限制排除了更精细的季度或月度波动分析。此外,微型数据溯源标注(如来源代码与备注)的解析需兼顾自动化清洗与人工校验平衡,以确保时间序列的可复现性。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中亚洲20个国家2000年至2025年间壮年就业人口(prime-age employed persons)的周均实际工作小时数,按性别、家庭类型及城乡地域进行细致分层。经典使用场景聚焦于跨国劳动供给行为的比较研究,尤其适用于面板数据分析与时间序列建模,以揭示亚洲各国在工作时间模式上的异质性及其演变趋势。
解决学术问题
数据集有效解决了区域劳动经济学中因微观数据稀缺导致的跨国可比性难题。学者可利用其分层结构,探讨性别差异、家庭结构及城乡二元经济对劳动供给决策的交互影响,识别工作时间变化的长期趋势与周期性波动,从而为理解亚洲劳动力市场的结构性特征与经济发展阶段的关联提供量化基础。
衍生相关工作
基于该数据源,研究者已发展出一系列经典工作,包括利用分层贝叶斯模型估计亚洲各国工时收敛性的跨国研究,以及结合其他ILOSTAT指标构建的劳动力市场脆弱性指数。此外,通过整合该数据集与宏观经济面板数据,衍生了关于工作时间与生产率、非正规就业关联性的实证分析,为劳动经济学的理论拓展贡献了亚洲视角。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务