遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-age-jbc-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含35,695个观测值,涉及亚洲28个国家的员工实际每周平均工作小时数数据,时间跨度为1999年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API直接获取,并过滤为亚洲国家代码。数据集涵盖了按性别、年龄和合同类型细分的指标,具体指标为“员工实际每周平均工作小时数,按性别、年龄和合同类型分类”。数据结构包括国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、合同类型分类、观测年份、观测值、观测状态等列。数据质量方面,数据为年度频率,ILO选择“最佳来源”处理多来源情况,细分列仅在指标发布该细分时非空。数据集适用于表格分类、回归和时间序列预测等任务,可用于分析亚洲地区劳动力市场的工作时间趋势。数据集由Electric Sheep Asia重新打包,以方便机器学习使用,遵循CC-BY-4.0许可。

This dataset contains 35,695 observations of mean weekly hours actually worked per employee across 28 Asia countries, spanning from 1999 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled directly via the REST API and filtered to Asia ISO3 country codes. It covers the indicator Mean weekly hours actually worked per employee by sex, age and type of job contract. The schema includes columns such as ref_area (country code), ref_area.label (country name), source, indicator, sex, classif1 (age), classif2 (contract type), time (year), obs_value (observed value), and obs_status. Data is annual frequency, with the ILO-selected best source used when multiple sources exist for the same country and year. Disaggregation columns are non-null only when the indicator publishes that breakdown. The dataset is repackaged by Electric Sheep Asia for machine learning readiness, suitable for tabular classification, regression, and time-series forecasting tasks, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-age-jbc-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,基于ILO统计部门对各国劳动力调查、家庭收入调查及行政记录等原始微观数据的协调与整合,遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。数据通过ILOSTAT REST API直接抽取,并依据亚洲ISO3国家代码进行区域过滤,最终汇集了来自28个亚洲国家的35,695条观测记录,时间跨度涵盖1999年至2025年。每条记录均包含来源标志(source.label)以追溯数据出处,确保数据的可溯源性与透明度。
使用方法
用户可通过HuggingFace datasets库便捷加载数据:使用`load_dataset("electricsheepasia/asia-ilo-how-xees-sex-age-jbc-nb-mean-weekly-hours-actually-worked-per-employee-by")`即可获取训练集并转换为Pandas DataFrame进行后续操作。支持按国家代码(如`df[df["ref_area"] == "IDN"]`)筛选单一国家数据,也可对特定指标进行时间序列可视化(如按年份排序并绘制obs_value曲线)。此外,可利用pivot_table将数据重塑为国家×年份的矩阵格式,便于跨区域对比与面板数据分析。数据集格式规范、字段齐全,适用于表格分类、回归及时间序列预测等任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年整理发布,并经Electric Sheep Asia在HuggingFace平台重新封装,旨在系统记录亚洲28个国家1999至2025年间雇员实际每周平均工作小时数的多维分布特征。作为ILOSTAT核心指标库的重要组成部分,该数据集聚焦于劳动时间领域,通过性别、年龄及合同类型三个核心维度对工时数据进行细粒度拆解,为探究亚洲劳动力市场结构性变迁、性别平等进程以及非正规就业演变提供了高分辨率的时间序列数据。自发布以来,该数据集已吸引劳动经济学、发展经济学与公共政策领域的广泛关注,成为研究亚洲地区工作条件与劳动者福祉的重要基准参考。
当前挑战
该数据集所面临的挑战首先来自领域问题层面:劳动工时数据的解读需跨越国家间统计口径差异与数据质量鸿沟,不同来源的劳动力调查在抽样设计、问卷措辞及时效性上存在显著异质性,导致跨国比较与长时间序列分析时面临信度与效度的双重考验。其次,在构建过程中,数据整合面临多重技术难题:ILOSTAT依托多国原始调查微观数据进行标准化协同处理,而各国数据发布时间与修订频率不一致,使得跨年度数据的断点与修订标记(如'Break in series')成为不可忽视的噪声来源。此外,按性别、年龄与合同类型叠加后的子类样本量分布极不均衡,尤其在少数发展中国家细粒度维度下观测值稀疏,严重制约了基于细分类别的统计推断与机器学习建模的稳定性和代表性。
常用场景
经典使用场景
在劳动经济学与人口统计学领域,研究人员通常利用这一数据集探究亚洲各国不同性别、年龄及合同类型雇员实际工作时间的分布特征与演变趋势。该数据覆盖28个亚洲国家长达二十余年的观测值,为跨国比较提供了宝贵的纵向时间序列。经典应用包括构建面板数据回归模型,以分析工作时间与宏观经济变量(如GDP、失业率)之间的关联,或采用统计分解方法评估性别差异在劳动市场中的动态变化。其精细的分类维度使得研究者能够剥离出合同类型对工作时长的独立效应,为理解劳动力市场结构性变迁提供了坚实的数据支撑。
解决学术问题
该数据集有效解决了亚洲劳动市场研究中长期存在的微观数据不一致与时间跨度不足的学术困境。通过国际劳工组织统一标准化的调查方法,它缓解了跨国数据可比性差的难题,使学者得以在控制国家固定效应后,系统检验工作时间与性别平等、青年就业、非正规就业等核心议题的理论假设。例如,研究者可用以验证是否存在女性在非标准合同下工作时间被压缩的普遍模式,或是评估劳动合同法制改革对实际劳动时长的因果影响。数据集为测量可持续发展目标中的体面劳动指标贡献了不可或缺的实证基础。
实际应用
在政策制定与社会调查实践中,该数据集为亚洲各国劳动部门及国际组织提供了关键的数据参照。决策者可据此识别特定行业或人群(如女性临时合同工)是否存在超时劳动或工时不足等非标准情况,从而设计更具针对性的劳动保护法规与社会保障方案。商业咨询机构亦利用该数据预测区域劳动力供给弹性,辅助企业在亚洲进行人力资源配置与运营成本核算。此外,非政府组织可基于工作时间的性别差异证据,推动旨在减少劳动市场歧视的倡导活动,促进体面劳动理念在亚洲的落地。
数据集最近研究
最新研究方向
在亚太劳动经济研究领域,该数据集为探究工作时间与性别、年龄及合同类型的多维交互提供了关键实证基础。当前前沿方向聚焦于后疫情时代非标准就业形态下工作时长的异质性演变,尤其关注女性临时工与青年非正规就业群体的工时波动规律。借助该跨26年、覆盖28个亚洲经济体的标准化面板数据,研究者可精准追踪1999至2025年间亚洲劳动力市场的结构性变迁,并结合ILO统一方法论追溯各国劳动调查的源数据差异。其对欠发达地区与东亚发达经济体的并行记录,为揭示全球化生产网络中工时趋同与分化并存的现象提供了不可替代的实证锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务