遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-eco-est-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,专注于亚洲地区25个国家从2000年至2025年的工作小时数指标。具体来说,它记录了每个就业人员实际平均每周工作小时数,并按性别、经济活动和机构规模进行细分。数据集共有81,512个观测值,涵盖一个核心指标:HOW_TEMP_SEX_ECO_EST_NB(按性别、经济活动和机构规模划分的每个就业人员实际平均每周工作小时数)。数据通过ILOSTAT REST API获取,并经过处理以覆盖亚洲国家,采用国际劳工统计学家会议(ICLS)的定义进行标准化。数据集包括国家代码、年份、观测值、数据来源、分类变量(如性别、经济部门、机构规模)以及数据质量标志(如可靠性状态)。它适用于表格分类、回归和时间序列预测任务,旨在为研究亚洲劳动力市场、工作时间趋势和就业状况提供机器学习就绪的数据。

This dataset contains statistical data from the International Labour Organization (ILO) ILOSTAT database, focusing on Hours of work indicators for 25 Asian countries from 2000 to 2025. Specifically, it records the mean weekly hours actually worked per employed person, disaggregated by sex, economic activity, and establishment size. The dataset comprises 81,512 observations and covers one key indicator: HOW_TEMP_SEX_ECO_EST_NB (Mean weekly hours actually worked per employed person by sex, economic activity and establishment size). Data is sourced directly from the ILOSTAT REST API, processed to include Asian countries, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. It includes country codes, years, observed values, data sources, classification variables (e.g., sex, economic sector, establishment size), and data quality flags (e.g., reliability status). The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, designed to provide ML-ready data for researching labor markets, working time trends, and employment conditions in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-eco-est-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接获取指标`HOW_TEMP_SEX_ECO_EST_NB`的数据,并依据亚洲国家ISO3代码进行地理区域筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,数据来源涵盖劳动力调查、家庭收入调查、企业调查及行政记录等多种渠道,并在`source.label`字段中标注原始来源,以确保数据的可追溯性与透明度。最终经Electric Sheep Asia重新打包,形成包含81,512条观测值、覆盖25个亚洲国家、时间跨度从2000年至2025年的结构化表格数据集。
特点
该数据集的核心特色在于其精细的分层结构,提供了按性别(总、男、女)、经济活动部门及企业规模三个维度对“受雇者实际周平均工作小时数”的详尽分解。数据结构采用标准化的列式设计,包含国家代码、数据来源、指标代码、分类变量、观测年份、数值及状态标志等字段,便于进行多维度的交叉分析与时间序列研究。此外,数据集遵循cc-by-4.0许可协议公开共享,并提供了ILOSTAT官方来源与Electric Sheep Asia重新打包版本的双重引用指引,兼顾学术规范与使用便捷性。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数直接加载该数据集,加载后转化为Pandas DataFrame格式进行后续分析。典型用法包括:按特定国家代码(如`ref_area == 'IDN'`)筛选子集进行国别聚焦分析;按指标代码排序后利用`obs_value`字段绘制时间序列曲线,以观察工作小时数在时间维度上的演变趋势;还可通过`pivot_table`方法将数据重塑为以时间(年份)为行、国家为列的矩阵形式,便于进行跨国横向比较或作为机器学习的表格输入特征。数据集的所有分类字段均提供了对应的英文标签列,降低了数据解读与可视化的门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Asia重构后托管于HuggingFace平台,聚焦亚太地区25个国家在2000年至2025年间按性别、经济活动与机构规模划分的就业人员周均实际工时数据。数据集源自ILOSTAT数据库,该数据库作为全球劳动统计的权威枢纽,整合了来自劳动力调查、家庭收支调查及行政记录等多源异构数据。此数据集为劳动经济学、发展经济学及公共政策研究提供了标准化的微观面板数据,尤其有助于揭示亚洲新兴经济体劳动力市场的结构性特征与时间利用模式变迁。作为综合工时指标的分地区延伸,该数据填补了亚洲区域高分辨率劳动投入数据集的空白,为跨国比较与动态趋势分析奠定了坚实基础。
当前挑战
该数据集所解决的领域核心难题在于劳动时间数据的跨国可比性与细粒度分裂。各国在工时统计的采集口径、抽样方法和行业分类标准上存在显著异质性,而ILOSTAT通过统一采用国际劳工统计学家会议定义进行规范化处理,实现了数据的跨时空一致性。然而,数据本身仍面临多重挑战:其一,观测值中存在‘不可靠’状态标志与大量覆盖缺口,部分国家或年份的数据由推算或替代来源补全,影响因果推断的稳健性;其二,数据仅提供年度频率,无法捕捉年内波动与季节性效应,限制了时序预测模型在短期劳动力调配中的适用性;其三,原始调查的样本选择偏差与回忆误差在低中收入国家尤为突出,可能低估非正规部门的工时特征,这在以灵活就业为主的亚洲经济体中尤为棘手。
常用场景
经典使用场景
该数据集收录了2000年至2025年间25个亚洲国家共计81,512条观测记录,核心指标为不同性别、经济活动类型及企业规模下受雇人员实际工作周均小时数。作为ILOSTAT官方数据在亚洲区域的精细化重构,它天然适用于时间序列预测任务,研究者可借此构建区域性劳动力工时变迁模型。在表格分类与回归任务中,该数据集为探索性别、产业归属与工时之间的多维关系提供了规范化样本,尤其适合分析亚洲新兴经济体与发展中国家劳动市场的结构性差异。
解决学术问题
在劳动经济学与社会统计学领域,亚洲长期缺乏跨国家、长时段且具有统一标准化定义的工时面板数据。该数据集直接回应了这一真空:它使学者能够系统量化亚洲各国间工作强度的演变轨迹,评估产业转型与劳动力政策对工时的异质性影响。基于其精细的性别与经济活动分类维度,研究者得以深入剖析女性劳动参与率上升背后的工时分配模式,以及不同规模企业对工时弹性的调节作用,为理解全球化语境下亚洲劳动市场的微观基础提供了坚实的数据基石。
衍生相关工作
基于ILOSTAT全球数据框架,该亚洲子集推动了多项开创性研究。例如,有工作利用其性别-行业交叉分组验证了亚洲经济体在产业升级过程中呈现的'工时-生产率'脱钩现象。另一些衍生研究则将其与国民账户数据融合,揭示了非正规就业与长工时之间的关联机制。在机器学习领域,该数据集常被用作多任务学习基准,研究者同时预测工时水平及其性别差异,从而评估模型在结构化社会指标上的泛化能力。此外,该数据在因果推断研究中也被用于识别最低工资政策对企业用工时长的真实效应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务