遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-age-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲33个国家从1996年至2025年的16,122条观测数据,涉及工作时长指标。具体指标为按性别和年龄划分的雇员实际平均每周工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并过滤为亚洲国家。数据集包含国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、年龄分类、观测年份、观测值、观测状态等字段。数据以年度频率发布,涵盖了不同性别(总计、男性、女性、其他)和年龄组(如15岁以上)的细分维度。数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供统一、机器学习就绪的数据层。

This dataset contains 16,122 observations of Hours of work data across 33 Asia countries, spanning 1996–2025, covering 1 distinct indicator: Mean weekly hours actually worked per employee by sex and age. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via its REST API and filtered to Asia ISO3 country codes. It includes fields such as country code, country name, data source, indicator code, indicator name, sex disaggregation, age classification, observation year, observed value, and observation status. The data is published at annual frequency and provides breakdowns by sex (total, male, female, other) and age groups (e.g., 15+). The dataset is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia on HuggingFace.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-age-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,经由Electric Sheep Asia团队精心重封装而成。数据通过ILOSTAT的REST API直接获取,过滤出亚洲33个国家的ISO3代码区域,涵盖了1996年至2025年间的劳动工时信息。ILOSTAT基于国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行统一协调与清洗,从而保证了指标的可比性与数据质量。每次观测都附带了数据来源标注,以便用户追溯原始调查类型,增强了数据使用的透明度和可信度。
使用方法
本数据集已整合为HuggingFace Datasets标准格式,用户可通过一行代码`load_dataset("electricsheepasia/asia-ilo-how-xees-sex-age-nb-mean-weekly-hours-actually-worked-per-employee-by")`快速加载,并方便地转换为Pandas DataFrame进行后续分析。示例用法包括:按国家代码筛选特定国家的数据(如印度尼西亚),针对单一指标按时间排序绘制趋势图,以及通过数据透视表构建国家×年份的矩阵,以便进行横向对比。数据集设计兼顾了机器学习的易用性与统计分析的灵活性,无论是用于回归模型的特征工程、分类任务,还是时间序列预测,都能无缝接入工作流。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,并由Electric Sheep Asia在HuggingFace上重新打包整理,聚焦于亚洲33个国家1996年至2025年间按性别和年龄划分的雇员平均每周实际工作小时数。其核心研究问题在于揭示亚洲地区劳动力市场中工作时间模式的异质性,为劳动经济学、性别平等及可持续发展目标(SDG)中体面劳动议题提供量化依据。作为ILOSTAT数据库的关键子集,该数据集填补了亚洲区域高频、细粒度劳动时间统计的空白,尤其适用于跨国比较、面板数据建模及政策评估,对理解发展中国家与新兴经济体劳动供给动态具有重要参考价值,并推动了机器学习和统计模型在劳动经济学领域的交叉应用。
当前挑战
该数据集所解决的领域挑战主要包括:1)亚洲各国劳动力调查口径差异导致的跨国产出可比性问题,例如不同国家对“实际工作小时数”的定义和测量方式存在分歧,需依赖ILOSTAT基于ICLS标准的统一协调;2)性别与年龄维度的数据稀疏性,如部分国家中女性或特定年龄段的观测值缺失或不完整,影响细分群体分析。构建过程中的挑战则涉及:3)多源异构数据的整合,包括各国劳动力调查、行政记录等不同来源的标注与标准化;4)数据质量标注的复杂性,如“obs_status”字段中“不可靠”(U)标记的存在,要求用户仔细甄别观测值的可信度,且部分时间序列因方法论修订(如“indicator.label”中的“Break in series”)而出现断裂,需谨慎进行时间序列分析。
常用场景
经典使用场景
在劳动经济学与人口统计学领域,该数据集为研究者提供了跨时空、跨性别的亚洲工作时间基准数据,最经典的用途是构建面板回归模型,探究宏观经济周期、产业结构变迁与劳动时长之间的动态关联。借助覆盖33个国家、跨度近30年的观测值,学者能够系统分析性别差异在工作时间上的演化趋势,并利用年际波动评估劳动政策调整对就业质量的干预效果。此外,因数据以标准化ILOSTAT指标入库,兼容时间序列预测与分类回归任务,研究者可借助机器学习方法挖掘非线性模式,例如预测特定年龄群体在城镇化进程中的劳动供给弹性。
解决学术问题
该数据集有效弥补了亚洲区域劳动力统计碎片化的短板,解决了跨国产出可比性不足与微观劳动调查不一致的学术困境。长期以来,发展经济学面临的一大障碍是难以获取统一口径的亚洲多国工作时序数据,致使“亚洲悖论”——即快速经济增长与劳动时间长度的扁平化现象——缺乏实证支撑。通过ILO标准化的性别与年龄分层统计,研究者能够识别劳动力市场中隐含的系统性歧视与代际差异,进一步检验性别工资差距与工作时长之间的交互机制。这一数据基础推动了劳动经济学从单国案例向区域整体规律的跃迁,为国际比较研究提供了可靠的数据锚点。
实际应用
在实际应用中,该数据集为国际组织与政策制定者提供了动态监测亚洲劳动力市场的数字化工具。国际劳工组织可依此对成员国实现体面劳动目标(SDG 8)的进展进行年度评估,识别劳动时长超标的行业热点,从而定向输出技术援助与政策建议。各国劳动与社会保障部门通过对比邻国数据,能够校正自身工时统计偏差,优化劳动监察资源配置。面向企业而言,跨国人力资源管理部门可使用该数据集基准化全球用工时长,预防因文化差异导致的合规风险。在非盈利层面,非政府组织亦可借助性别与年龄维度的细化指标,精准开展劳动者权益倡导项目,推动女性与青年群体的工作条件改善。
数据集最近研究
最新研究方向
当前,围绕亚洲区域劳动市场的恢复力与结构性变迁,该数据集为探究后疫情时代工作时长异质性提供了宝贵的时间序列素材。前沿研究方向聚焦于利用性别与年龄维度的精细分层,揭示不同亚群体在周均实际工时上的分化轨迹,并关联自动化、零工经济与劳动力老龄化等热点议题。借助ILOSTAT标准化度量与覆盖33国近三十载的庞大规模,研究者得以构建跨国面板模型,评估政策干预与宏观经济波动对劳动供给的差异化冲击,为亚洲发展型国家的体面劳动议程提供实证锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务