遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-eco-geo-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲27个国家从1997年至2025年的28,496个观测值,专注于工作时数数据,具体指标为按性别、经济活动和城乡划分的雇员平均每周实际工作时间。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集包括年度数据,涵盖国家代码、来源、指标、性别(总计、男性、女性)、经济活动分类、城乡分类、观测年份、观测值(如平均每周小时数)以及数据质量标志等列。数据经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)定义,确保可比性。数据集适用于表格分类、回归和时间序列预测任务,旨在为亚洲劳动力市场研究提供机器学习就绪的数据层。

This dataset contains 28,496 observations of Hours of work data across 27 Asia countries, spanning from 1997 to 2025, with the specific indicator Mean weekly hours actually worked per employee by sex, economic activity and rural / urban areas. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via API and filtered to Asia country codes. It includes annual data with columns such as country code, source, indicator, sex (total, male, female), economic activity classification, rural/urban classification, observation year, observed value (e.g., mean weekly hours), and data quality flags. The data is harmonized using ICLS (International Conference of Labour Statisticians) definitions for comparability. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, designed as a machine learning-ready data layer for Asian labor market research.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-eco-geo-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接获取原始指标(HOW_XEES_SEX_ECO_GEO_NB),并依据亚洲ISO3国家代码进行地理筛选。数据采用国际劳工统计学家会议(ICLS)定义进行标准化处理,原始调查微观数据来源在source.label列中予以标注,以确保可追溯性。最终整合为包含28,496条观测值、横跨27个亚洲国家、时间跨度覆盖1997年至2025年的结构化表格数据,以Parquet格式存储并统一发布。
特点
数据集聚焦于按性别、经济活动与城乡区域划分的雇员平均每周实际工作小时数,包含一个核心指标与丰富的分类维度。其独特之处在于提供了性别(总、男、女、其他)及两项分类变量(如经济部门、地理覆盖范围)的多维拆解,便于研究者从不同视角开展分析。此外,数据集对数据质量进行了标识,如观测状态标记(如不可靠值)和方法论变更注释,增强了数据的透明度和可用性,适用于表格分类、回归分析及时间序列预测等多种任务。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并转换为Pandas DataFrame进行后续操作。示例中展示了针对特定国家(如印度尼西亚)的数据筛选、单一指标的时间序列可视化,以及构建国家×年份透视矩阵的方法。数据集兼容Python生态,支持按ref_area、indicator等字段进行灵活切片,便于劳动经济学领域的快速探索与建模。建议在使用时引用原始ILO数据及Electric Sheep Asia的重新打包版本以遵循CC-BY-4.0许可协议。
背景与挑战
背景概述
在全球劳动力市场研究中,工作时长是衡量劳动强度、性别平等与经济发展水平的关键指标。国际劳工组织(ILO)下设的ILOSTAT数据库作为全球劳动统计的权威枢纽,持续整合各国劳动力调查数据,为政策制定与学术研究提供基础。该数据集由Electric Sheep Asia于2025年重新整理并发布于HuggingFace平台,聚焦亚洲地区27个国家1997至2025年间按性别、经济活动及城乡划分的员工平均每周实际工作小时数,共计28,496条观测记录。其核心研究问题在于揭示亚洲各国劳动力工作时间模式的异质性,服务于劳动经济学、性别研究及可持续发展目标(SDG)中体面工作的监测与评估。数据集的系统化发布显著降低了亚洲地区跨国产出比、劳动参与率等面板数据分析的获取门槛,推动了区域劳动力市场的比较研究与计量建模。
当前挑战
该数据集面临的首要领域挑战是亚洲经济体间统计标准与调查方法的显著差异,诸如各国家劳动调查的采样框架、行业分类与工时定义虽经ILO依据国际劳动统计学家会议(ICLS)标准进行调和,但原始数据来源的异质性仍可能影响跨国可比性。构建过程中,挑战来自多重维度:数据源整合需通过ILOSTAT REST API获取,依赖接口稳定性与第三方维护;不同国家因调查频次、样本覆盖周期不一,导致时间序列非均衡,如土耳其仅覆盖2000–2013年而韩国可达2025年;部分观测值因样本量不足被打上不可靠(unreliable)标记,需在分析中谨慎处理;此外,分类维度中性别、城乡等特征的缺失值分布差异,亦要求研究者设计鲁棒的缺失数据处理策略。
常用场景
经典使用场景
在全球劳动力市场的宏观图景中,工时数据始终是衡量工作强度与经济活力的关键指标。该数据集汇集了1997年至2025年间亚洲27个国家、共计28,496条关于雇员实际周均工时的观测记录,并依据性别、经济活动部门及城乡区域进行精细分层。研究者可借助这一多元结构,系统分析不同人口群体在工时分配上的异质性,识别经济发展模式下的劳动供给特征,为比较劳动经济学与区域发展研究提供数据支撑。
实际应用
在实际应用层面,该数据集对于国际组织、政府机构及社会研究智库具有重要的决策参考价值。国际劳工组织可利用这些数据评估亚洲各国实现体面劳动目标的进展,监测工时过长或过短等异常信号。各国劳动部门可借助性别与区域维度的细分信息,制定更具针对性的就业促进政策,例如针对女性及农村劳动力的工时保护措施。此外,该数据还可用于构建宏观经济预警模型,作为研判劳动力市场供需失衡的重要指标,助力精准干预。
衍生相关工作
围绕该数据集,已经衍生出若干富有影响力的学术工作。在时间序列预测领域,研究者构建了基于机器学习的工时趋势模型,用于预测亚洲各国未来五年的工时变化,并识别潜在的经济波动信号。在因果推断方面,有学者利用该数据考察最低工资制度对周工时的影响,结合性别与经济活动的交互效应,提供了政策评估的新视角。此外,结合ILOSTAT其他数据库的整合性研究也层出不穷,诸如将工时与劳动生产率、失业率联合分析,为亚洲劳动力市场的综合建模贡献了宝贵洞见。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务