遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-ocu-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的每周员工实际平均工作小时数(按性别和职业分类)指标数据,专门针对亚洲地区。数据涵盖38个亚洲国家,时间跨度为1997年至2025年,共17,235个观测值。核心指标为HOW_XEES_SEX_OCU_NB,表示按性别和职业划分的员工每周实际平均工作小时数。数据集经过ILO的标准化处理,数据来源包括劳动力调查、家庭收入调查等,并包含国家代码、年份、性别、职业分类、观测值及数据质量标志等字段。它适用于表格分类、回归分析和时间序列预测等任务,旨在为研究亚洲劳动力市场提供机器学习就绪的数据支持。

This dataset contains the Mean weekly hours actually worked per employee by sex and occupation indicator data from the International Labour Organization (ILO) ILOSTAT database, specifically for Asia. It covers 38 Asian countries from 1997 to 2025, with 17,235 observations. The core indicator is HOW_XEES_SEX_OCU_NB, representing mean weekly hours actually worked per employee disaggregated by sex and occupation. The data is harmonized by ILO using International Conference of Labour Statisticians definitions, sourced from labour force surveys, household income surveys, and administrative records. It includes fields such as country code, year, sex, occupation classification, observed values, and data quality flags. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, providing ML-ready data for labor market research in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-ocu-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT数据库,聚焦于亚洲地区雇员按性别与职业划分的实际周均工时。Electric Sheep Asia团队通过ILOSTAT公开的REST API接口直接提取底层指标数据,并依据ISO 3166-1 alpha-3编码精准筛选出涵盖38个亚洲国家的观测记录。原始数据经过ILO基于国际劳工统计学家会议(ICLS)定义进行标准化整合,同时保留来源标识列以保证数据可追溯性,最终形成包含17,235条观测的时间序列表格。
特点
数据集涵盖1997年至2025年间38个亚洲国家的工时数据,唯一核心指标为“按性别和职业划分的雇员实际周均工时”。其结构特色在于多维度的细分变量,包括性别(总、男、女、其他)与职业分类(如技能水平),以及丰富的元数据注释列,如数据源标识、观测状态标记和系列断点说明。数据质量方面,当同一国家年份存在多个来源时,优先采用ILO指定的“最佳来源”,并确保年度频率的一致性。
使用方法
使用HuggingFace的`datasets`库可通过`load_dataset`一键加载该数据集,并直接转换为Pandas DataFrame进行后续分析。用户可按国家代码筛选特定区域数据,或利用`time`与`obs_value`列对单个指标进行时间序列可视化。若要构建跨国面板数据,可通过`pivot_table`方法将数据重塑为国家×年份的矩阵形态,便于开展比较性回归或时序预测建模。所有操作均基于标准Python环境,快速便捷。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)创建,并经Electric Sheep Asia于2025年整理发布,聚焦于亚洲38个国家1997至2025年间按性别和职业划分的雇员周均实际工作时长。作为全球劳动统计的权威来源,ILOSTAT通过统一采用国际劳动统计学家会议(ICLS)定义,整合各国劳动力调查、家庭收入调查、企业调查及行政记录等微观数据,使得跨国的劳动时间比较成为可能。该数据集的核心研究问题在于揭示亚洲地区工作时间的性别与职业分层特征,为劳动经济学、发展经济学及社会政策研究提供了稀缺的、系统化的面板数据基础,尤其对理解亚洲劳动力市场的结构性变迁与性别不平等议题具有重要参考价值。
当前挑战
该数据集所应对的领域挑战是亚洲劳动市场中工作时间数据的碎片化与标准化缺失。各国统计体系与调查方法差异显著,ILOSTAT虽进行了数据协调,但记录中仍存在因方法论修订导致的序列中断(如'Break in series: Methodology revised'标识)以及数据可靠性标记(如'Unreliable'状态),降低了时间序列的一致性与可比性。构建层面的挑战包括:原始数据来源多样,同一国家不同年份可能使用了不同的调查类型或最佳来源选择,导致跨年度直接对比需谨慎处理;同时,按性别与职业的细粒度分解(如`sex`与`classif1`字段)在部分年份或国家存在大量缺失,限制了多维度交叉分析的空间。此外,数据年度频率的限制使得无法捕捉季节性或短期波动,进一步制约了对劳动力市场动态的精细刻画。
常用场景
经典使用场景
在劳动经济学与时间利用研究领域,该数据集以性别与职业为双重维度,系统呈现了亚洲38个国家1997至2025年间雇员平均每周实际工作小时数的演变轨迹。研究者可借助此数据集开展跨国纵向比较分析,揭示亚洲地区不同性别群体在各类职业中的劳动时间差异格局,并探索经济发展、产业结构转型与劳动供给行为之间的深层关联。其经典用法聚焦于通过面板数据模型刻画工作时间的变化趋势,为理解亚洲劳动力市场的动态特征提供坚实的数据基础。
解决学术问题
该数据集有效回应了亚洲地区性别劳动时间不平等这一长期悬而未决的学术议题。通过提供标准化的性别与职业交叉分类数据,研究者得以量化评估女性在特定职业中是否面临更长的无酬劳动时间,或男性是否在高技能岗位上承担更多加班负担。此外,它解决了跨国比较中因统计口径不一而导致的测量偏差难题,为检验性别角色分工理论、职业隔离假说以及工作时间收敛假说提供了可靠的经验证据,推动了劳动经济学与性别研究的交叉发展。
衍生相关工作
该数据集催生了一系列具有影响力的后续研究工作。基于其时间序列与多维度特征,学者们构建了预测亚洲各国未来工时演变趋势的自回归移动平均模型与深度学习模型。另有工作将其与ILOSTAT的工资、失业率数据进行联合分析,探究劳动时间与经济周期、产业结构变迁之间的互动机制。在方法层面,研究者利用该数据验证了缺失值插补算法在劳动统计中的有效性,并开发了针对面板数据的不确定性量化工具,进一步拓宽了该数据集的学术价值与应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务