遇见数据集

electricsheepasia/asia-ilo-how-xees-eco-ocu-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于亚洲33个国家从1997年到2025年的员工每周实际平均工作小时数的数据集,按经济活动和职业分类。数据集包含132,670个观测值,覆盖一个核心指标:员工每周实际平均工作小时数(按经济活动和职业分类)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,这是一个全球劳动力统计的权威来源,通过调查和行政记录收集,并经过ILO的标准化处理。数据集由Electric Sheep Asia重新打包,以方便机器学习使用,包括表格分类、回归和时间序列预测等任务。数据以年度频率发布,包含国家代码、来源、指标、分类变量、年份、观测值和质量标志等列。

This dataset contains 132,670 observations of mean weekly hours actually worked per employee by economic activity and occupation across 33 Asian countries from 1997 to 2025. It features one key indicator: mean weekly hours actually worked per employee, disaggregated by economic activity and occupation. The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, which harmonizes labor statistics from surveys and administrative records. Repackaged by Electric Sheep Asia for machine learning readiness, it supports tasks like tabular classification, regression, and time-series forecasting. The data is annual and includes columns for country codes, sources, indicators, classification variables, years, observed values, and quality flags.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-eco-ocu-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API接口直接拉取指标为'HOW_XEES_ECO_OCU_NB'的原始数据,并依据亚洲地区ISO3国家代码进行筛选与整合。ILOSTAT团队依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行协调与标准化处理,并在'source.label'字段中标注数据来源以保障可追溯性。数据集最终由Electric Sheep Asia团队重新封装,形成包含132,670条观测记录的机器学习就绪格式,覆盖33个亚洲国家,时间跨度从1997年至2025年。
特点
该数据集聚焦于“按经济活动与职业划分的雇员平均每周实际工作小时数”这一单一核心指标,但通过丰富的分类变量(如经济活动大类、技能等级)实现了多维度精细剖析。其独特之处在于整合了来自33个亚洲国家长达近三十年的年度数据,每条记录均附有观测状态标志(如可靠性标注)及详细的系列中断或方法修订注释,为数据质量评估提供了透明依据。此外,数据集采用统一架构设计,包含国家代码、来源标签、分类变量及观测值等标准化字段,便于跨国家、跨时期的时间序列分析与面板数据构建。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset`函数直接加载数据,将其转换为Pandas DataFrame后即可进行灵活操作。例如,通过`ref_area`字段筛选特定国家的数据子集,或对单一指示器进行按年份排序以绘制时间序列趋势图。高级应用包括利用`pivot_table`方法将数据重塑为国家×年份的矩阵形式,便于进行面板回归或跨国家比较分析。数据集字段设计清晰,用户可结合`classif1`与`classif2`的标签信息,按经济活动或职业类别进行分组统计,深入探究不同劳动力细分群体的工时动态变化。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDG)研究领域,工作时间的精确测度是评估劳动力市场效率、劳动者福祉及经济生产力的核心指标。然而,亚洲地区因国家发展水平、统计体系及数据发布机制各异,长期以来缺乏一个统一、连贯且具备跨经济活动和职业分类的周工时数据库。为回应这一数据鸿沟,国际劳工组织(ILO)依托其权威统计数据库ILOSTAT,于2025年由Electric Sheep Asia团队重新打包发布了“亚洲各经济活动和职业雇员实际周均工时(ILOSTAT)”数据集。该数据集整合了33个亚洲国家自1997年至2025年的132,670条观测记录,专注于“HOW_XEES_ECO_OCU_NB”这一核心指标,为区域劳动力市场比较、政策评估及时序预测研究提供了标准化的科学基础,在亚洲劳动经济学与统计核算领域具有重要的基准价值。
当前挑战
该数据集所面临的挑战首先源于领域问题的复杂性:工作时间的分布受经济周期、产业转型、非正规就业及区域文化差异等多重因素影响,传统单指标建模难以捕捉其动态异质性,尤其在亚洲混合经济体中,职业与行业的交叉分类常导致样本稀疏与测量偏倚。此外,数据构建过程中面临显著的技术性困难,包括不同国家调查方法(如劳动力调查与行政记录)的衔接、ILO国际劳动统计学家会议(ICLS)定义下的数据协调、时间序列中因方法论修订引发的断裂(如note_indicator标识的断点)以及多源数据中“最佳来源”选择的透明性挑战。这些因素共同制约了模型跨域泛化能力,并增加了统计推断的不确定性。
常用场景
经典使用场景
该数据集汇集了ILOSTAT框架下亚洲33个国家1997至2025年间按经济活动与职业分类的雇员周平均实际工作小时数,共计132,670条观测记录。在劳动经济学与时间利用研究中,它常被用于构建面板数据模型,以分析不同产业与职业群体间工作时长的长期趋势与结构性差异。研究者可借助该数据开展跨国家、跨时期的比较研究,例如探索制造业与服务业雇员工作时间的收敛或分化轨迹,或评估职业技能等级对工作时长的异质性影响。
实际应用
在政策制定与国际发展领域,该数据集是监测体面劳动目标(SDG 8)进展的核心工具。各国劳动部门与国际组织可据此评估产业政策对工作时长的影响,识别超时工作频发的经济部门与职业类别,从而制定有针对性的劳动保护措施。企业人力资源管理者也可利用该数据校准行业基准工时,优化排班制度与薪酬结构。此外,非政府组织在倡导合理工时与工作生活平衡议题时,能够引用这些权威统计作为论证依据,推动劳动权益保障政策的完善。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的研究范式。在国际劳动组织发布的《全球工时报告》中,该数据被用于构建亚洲区域的工作时间全景图。学术界基于此数据开展了工作强度与劳动者健康的跨学科分析,建立了职业安全风险与工时延长之间的计量经济学模型。同时,该数据集推动了多国工时预测系统的开发,研究者利用时间序列方法建模亚洲各国工时的季节性与周期性波动,为宏观经济预警与劳动力市场规划提供了方法论创新。数据集的标准化格式也促进了与ILOSTAT其他指标(如就业率、工资水平)的联合分析,催生了关于劳动生产率与工作时长关系的综合性实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务