遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-ocu-geo-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1997年至2025年间27个亚洲国家按性别、职业和城乡地区划分的每个员工实际平均每周工作时间的观察数据,共有34,239个观察值,涵盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,并经过Electric Sheep Asia重新打包,用于表格分类、回归和时间序列预测等任务。

This dataset contains observational data on the actual average weekly working hours per employee across 27 Asian countries between 1997 and 2025, disaggregated by gender, occupation, and urban-rural regions, with a total of 34,239 observations covering 1 unique indicator. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), and repackaged by Electric Sheep Asia for tasks including tabular classification, regression, and time series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-ocu-geo-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)旗下的ILOSTAT统计数据库,经由Electric Sheep Asia团队精心提取与重整。研究者通过ILOSTAT的REST API,直接获取了标识符为HOW_XEES_SEX_OCU_GEO_NB的原始指标数据,该指标衡量的是按性别、职业及城乡区域划分的雇员平均每周实际工作小时数。在获取数据后,团队依据亚洲国家的ISO3国家代码进行严格过滤,仅保留涵盖27个亚洲经济体的观测记录,并利用ICLS(国际劳动统计学家会议)定义对各国劳动力调查的微观数据进行统一协调与标准化,确保了跨国家、跨年份数据的可比性与科学性。最终整合而成的数据集包含34,239条观测值,时间跨度从1997年至2025年,为研究亚洲劳动力市场提供了扎实的数据基础。
特点
本数据集的核心特色在于其精细的多维度分类结构。除了核心的观测值obs_value外,数据集中设置了sex、classif1和classif2三个分类列,分别对应性别(男性、女性、总计等)、职业技能等级(如总技能水平)以及地理覆盖范围(国家或城乡区域)。这种设计使得研究者能够从人口统计学和职业地理学的双重角度深入剖析工作时长模式。此外,数据集还包含了source.label、obs_status.label及note_indicator.label等元数据列,详细标注了每一条数据的来源、观测状态(如暂定值或不可靠值)以及可能的序列中断说明,赋予了数据极高的透明度和可追溯性,是进行严谨劳动经济学分析的可靠资源。
使用方法
使用该数据集极为便捷。用户仅需通过HuggingFace的datasets库,执行一行代码ds = load_dataset("electricsheepasia/asia-ilo-how-xees-sex-ocu-geo-nb-mean-weekly-hours-actually-worked-per-employee-by")即可将数据加载为标准的Pandas DataFrame对象。随后,研究人员可以轻松地依据国家代码(如ref_area列)进行单国分析,例如df[df['ref_area'] == 'IDN']聚焦印度尼西亚的工作时长趋势。对于时间序列分析,对特定指标按年份排序后,即可绘制出观察值随年份变化的折线图。数据集还支持通过pivot_table方法将数据重塑为国家与年份的矩阵形式,便于进行跨国比较或作为面板数据模型输入,极大地简化了从数据获取到分析的工作流。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Asia重新打包后托管于HuggingFace平台,旨在系统性地记录亚洲27个国家在1997至2025年间雇员平均每周实际工作小时数的变化趋势。其核心研究问题聚焦于揭示工作时间在不同性别、职业类型以及城乡地域之间的分布差异,为劳动经济学、社会政策评估以及可持续发展目标(特别是体面劳动指标)提供精细化的量化基础。作为ILOSTAT数据库的重要子集,这一数据集整合了各国劳动力调查等官方统计资源,通过统一的国际劳工统计学家会议(ICLS)定义进行标准化处理,使得跨国比较成为可能,进而推动了区域劳动力市场结构变迁的实证研究,并成为学术界与国际组织评估亚洲劳动政策效果的关键数据支柱。
当前挑战
该数据集面临的领域挑战包括:1)跨国工作时间数据的可比性与标准化难题,各国在调查设计、职业分类体系及城乡定义上存在差异,易引入系统性偏差;2)性别与职业层面数据可获取性不均,部分国家女性与特定职业群体的样本量较小,导致非正规部门与女性劳动参与的真实状况难以被充分刻画。构建过程中的挑战包括:1)多源异构数据的整合与一致性核验,需从ILOSTAT API中过滤出亚洲国家特定子集,并处理不同调查源之间的断点与注释标记;2)观测状态标记(如“不可靠”)的处理策略,需平衡数据完整性与质量可靠性间的张力,避免因过度清洗而丢失关键的时间序列信息。
常用场景
经典使用场景
该数据集聚焦于亚洲地区按性别、职业及城乡地域划分的雇员平均每周实际工作小时数,涵盖了1997年至2025年间27个亚洲国家的34,239条观测记录。其经典使用场景在于构建跨国家、跨时间维度的劳动工时面板数据,用于分析亚洲劳动力市场的时间配置模式。研究者可依据性别、职业技能等级和城乡类型等分类维度,系统性地比较不同人口群体间的工时差异,揭示经济发展阶段、产业结构变迁与劳动供给行为之间的内在关联。该数据以年频采样,便于整合进宏观经济学与劳动经济学的计量模型中,开展关于亚洲各国工时趋势的纵向比较研究。
实际应用
在实际应用中,该数据集为国际组织、政府统计部门及政策研究机构开展劳动市场监测与评估提供了基础数据支撑。通过追踪不同性别和职业群体周工作小时数的变化轨迹,决策者能够识别过劳风险高发行业或性别工时差距突出的地区,进而设计更具针对性的工时法规与劳动保护政策。企业的人力资源规划亦可从中受益,通过对比同区域竞争者或类似职业组的工时水平,优化内部排班结构与员工福祉方案。此外,该数据还可用于构建劳动力市场景气指数,辅助预测亚洲各国就业质量与生产效率的演进方向。
衍生相关工作
该数据集衍生的相关工作集中于劳动经济学的计量建模与机器学习预测领域。经典工作包括利用差分模型或面板固定效应回归,估计最低工资、社会保障缴费率等制度变量对工时强度的影响。在时间序列预测方向,研究者借助该数据集训练ARIMA或季节性分解模型,预测特定国家或职业组的未来工时波动,为劳动力供需预警系统提供输入特征。近年来,基于树模型与神经网络的回归任务也在此数据上得到验证,探索利用性别、地理和职业分类信息提升工时估计的泛化能力。这些衍生成果不仅拓展了ILOSTAT数据的学术价值,也为跨学科的劳动政策模拟奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务