遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-ec2-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲地区工作时间统计数据,具体指标为按性别和经济活动(ISIC第2级)划分的雇员实际平均每周工作时间。数据集涵盖32个亚洲国家从1997年至2025年的年度观测数据,共计57,398条记录。数据按性别(总计、男性、女性、其他)和经济活动类别进行细分,包含国家代码、年份、观测值、数据来源、质量标志等字段。数据集由Electric Sheep Asia重新打包,采用标准化模式,便于机器学习使用。

This dataset contains hours of work statistics for Asia from the ILOSTAT database of the International Labour Organization (ILO), specifically the indicator Mean weekly hours actually worked per employee by sex and economic activity - ISIC level 2. It covers 32 Asian countries with annual observations from 1997 to 2025, totaling 57,398 records. Data are disaggregated by sex (total, male, female, other) and economic activity categories, and include fields such as country code, year, observed value, data source, and quality flags. The dataset is repackaged by Electric Sheep Asia with a standardized schema for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-ec2-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接获取原始指标数据,并依据亚洲ISO3国家代码进行地理筛选与聚合。数据覆盖了1997年至2025年间32个亚洲国家的劳动统计信息,经由Electric Sheep Asia团队重新整理与标准化,封装为机器学习就绪的Parquet格式,确保数据的一致性与可追溯性。
特点
数据集包含57,398条观测记录,聚焦于'按性别和经济活动划分的雇员实际每周平均工作小时数'这一核心指标,并按ISIC二级分类进行细分。其特色在于提供了性别(总计、男性、女性、其他)和经济活动分类等多维度的拆分信息,同时标注了数据来源和观测状态(如不可靠、修订等),便于用户评估数据质量。数据以年频呈现,时间跨度近三十年,为长期劳动趋势分析提供了坚实的基础。
使用方法
数据集可通过HuggingFace的`datasets`库便捷加载,使用`load_dataset`命令即可获得可直接操作的Pandas DataFrame。用户可按国家代码进行筛选以分析特定地区,或利用时间序列绘图功能观察指标演变。此外,通过数据透视可轻松构建国家×年份的矩阵,适用于面板数据分析或时间序列预测建模。示例代码帮助快速上手,适合从事劳动经济学、社会统计及机器学习研究的从业者。
背景与挑战
背景概述
本数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布,并经Electric Sheep Asia重新封装整理,聚焦于亚洲32个国家1997至2025年间按性别和经济活动(ISIC二级分类)划分的雇员实际周平均工作小时数。数据集包含57,398条观测记录,源自各国劳动力调查、家庭收入调查及行政记录等官方数据源,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调处理。该数据集填补了亚洲地区劳动时间精细化统计的空白,为跨国产出弹性研究、劳动经济学建模及可持续发展目标(SDG)中体面劳动指标的监测提供了关键数据基础,对理解亚洲经济体中性别分工和产业差异具有重要参考价值。
当前挑战
该数据集解决的领域核心问题在于缺乏统一、可比的亚洲国家间劳动时间统计。各国调查方法、口径及时间频率差异显著,数据采集的可靠性标志(如'不可靠'状态)和序列断裂注解暴露了数据质量问题。构建过程中面临的主要挑战包括:其一,多源异构数据的协调处理,需将ILOSTAT中不同调查类型和分类体系的数据标准化为一致的时间序列;其二,分类维度的空缺处理,性别、经济活动的细分列存在缺失值,影响多维度分析;其三,观测值的稳定性难题,部分数据被标记为临时性或不可靠,增加了建模的不确定性;其四,长期数据的连续性维护,需应对调查修订导致的序列断裂问题,以保证时间序列分析的可靠性。
常用场景
经典使用场景
该数据集以国际劳工组织(ILO)权威发布的劳动统计为基石,聚焦亚洲32个国家1997至2025年间按性别与经济行业划分的雇员平均每周实际工作小时数。研究领域内,它常被用于跨国家、跨时段的劳动供给行为比较分析,通过面板数据结构揭示亚洲劳动力市场的时空演变规律。研究者可借助该数据开展性别差异视角下的工作时长决定因素探讨,或结合ISIC行业分类标准,深入剖析不同经济部门的劳动强度波动特征,为劳动经济学中的经典命题提供坚实的数据支撑。
解决学术问题
该数据集系统性地解决了亚洲区域劳动统计中长时序、多维度微观数据匮乏的学术困境。在过往研究中,跨国比较常受限于数据口径不一与样本碎片化,而此数据经由ILO统一标准整合并纳入劳动者性别与经济活动的交叉分类,使得探讨产业结构转型对工作时长的影响、分析女性劳动参与率提升背后的工时变化等关键问题成为可能。它填补了发展中国家劳动统计在细粒度分层上的空白,推动了关于经济增长与工作福祉关系的实证研究突破,尤其为评估国际劳工组织倡导的体面劳动目标在亚洲的进展提供了量化基石。
衍生相关工作
该数据集衍生出一系列具有深远影响的学术与工程工作。在计量经济学领域,研究者以此为基础构建了亚洲国家工作时长的动态面板预测模型,探索了对外贸易、技术变革与劳动强度的因果机制。同时,数据驱动下的时序列聚类分析催生了识别亚洲劳动市场制度相似性的分类方法。此外,该数据被整合进多个开源的可视化与统计平台,如结合时间序列工具箱形成交互式仪表盘,支持实时监测亚洲周工时变动格局。基于其格式化与跨时代的特性,它也常见于劳动经济学教科书与ILO年度报告的案例研究中,成为连接原始统计与政策叙事的关键桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务