遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-geo-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲27个国家员工实际平均每周工作小时数的统计数据,时间跨度为1996年至2025年,共有2,466条观测记录。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了按性别和城乡地区划分的工作小时数指标(HOW_XEES_SEX_GEO_NB)。数据集提供了详细的分类维度,包括性别(总计、男性、女性、其他)和地区类型(如全国范围),并包含数据来源、观测状态和注释等信息。数据经过ILO标准化处理,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 2,466 observations of mean weekly hours actually worked per employee across 27 Asia countries, spanning from 1996 to 2025. It covers the indicator HOW_XEES_SEX_GEO_NB, which provides data disaggregated by sex and rural/urban areas. The data is sourced from ILOSTAT, the ILOs central statistics database, and includes dimensions such as sex (total, male, female, other) and geographic classification. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, with harmonized data from national surveys and administrative records.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-geo-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口提取指标‘HOW_XEES_SEX_GEO_NB’的原始数据,并依据亚洲ISO3国家代码进行地理范围过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的标准,对各国劳动力调查、家庭收入调查等微观数据进行统一整合和规范化处理,确保指标口径的一致性。数据集最终包含27个亚洲国家1996年至2025年间的2466条观测记录,每条观测均标注了数据来源和状态标记,以支持可追溯性。
特点
该数据集聚焦于‘按性别和城乡划分的雇员每周实际平均工作小时数’这一单一指标,却融合了丰富的维度信息:性别的四个类别(总计、男性、女性及其他)、时间跨度的年度频率,以及地理覆盖的广泛性。数据集的特色在于其精细的统计分类体系,每条记录均携带源调查类型、数据质量状态(如‘序列断裂’)和修正说明,为用户提供了多层次的剖析视角。这种结构使得研究者能够从容挖掘亚洲地区劳动工时在时空和人口群体间的演变规律。
使用方法
该数据集封装为HuggingFace Datasets格式,可通过一行Python代码`load_dataset(‘electricsheepasia/asia-ilo-how-xees-sex-geo-nb-mean-weekly-hours-actually-worked-per-employee-by’)`直接加载,并自动转换为Pandas DataFrame进行分析。用户可按国家代码(如‘IDN’)过滤至特定区域,或利用指标列生成时间序列进行可视化。数据集还支持透视操作,可将原始长格式数据重塑为国家与年份的矩阵形式,便于进行面板数据建模或跨国家横向对比分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,并经Electric Sheep Asia重新打包以适配机器学习工作流。数据集聚焦于亚洲地区雇员按性别和城乡划分的平均每周实际工作小时数,覆盖27个亚洲国家、1996至2025年的2466条观测记录。该数据集的创建旨在系统性地整合和规范化来自各国劳动力调查的零散工时数据,为研究亚洲劳动力市场的性别差异、城乡结构变化及其对经济发展和劳动者福祉的影响提供统一、可比较的定量分析基础。在劳动经济学和区域发展研究中,工作小时数是评估劳动强度、就业质量和生活水平的关键指标,该数据集通过打破国家间数据口径不一致的壁垒,显著提升了跨区域、跨时间比较研究的可行性与可靠性。
当前挑战
该数据集面临的核心挑战首先在于解决亚洲各国劳动力统计标准不统一、调查方法差异大以及数据质量参差不齐的领域难题。ILOSTAT需依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行协调,但国家间在调查频率、样本设计、变量定义上的固有差异仍可能导致指标可比性受限。其次,构建过程中面临显著的数据整合挑战:需从多种来源(劳动力调查、家庭收入调查、行政记录等)提取数据,并在国家-年份层面筛选ILO选定的“最佳来源”,同时处理因方法论修订或调查断档导致的序列中断(如观察状态标记“B”表示序列中断)。此外,数据稀疏性(如部分国家仅含少量年份观测)与分类维度缺失(如城乡或按年龄分组数据的可用性不均)亦对构建一致的跨国家面板数据构成制约。
常用场景
经典使用场景
在劳动经济学与区域发展研究领域,该数据集的核心应用在于分析亚洲各国劳动者按性别和城乡地域划分的实际周均工作时间模式。研究者常利用其丰富的跨年度面板结构(1996–2025年,涵盖27个亚洲国家)开展跨国比较研究,探究经济发展阶段、劳动政策变迁与工作时长之间的动态关系。该数据为绘制亚洲劳动力市场的时空演变图景提供了不可多得的量化素材。
实际应用
在实际应用层面,该数据集可服务于多边组织、国家劳动部门及社会政策智库的循证决策过程。具体而言,它能够支持基于数据的性别平等政策效果评估,例如追踪男女工时差距是否随同工同酬法律的实施而收敛;亦可结合宏观经济指标,构建预警模型以识别劳动者过劳风险较高的国家与行业,从而为国际劳工组织制定体面劳动议程的区域优先事项提供精准的数据锚点与行动依据。
衍生相关工作
基于该数据集,衍生出了一系列聚焦亚洲劳动力市场的基准化分析与模型构建工作。其标准化的面板格式直接适配时间序列预测模型(如Prophet、LSTM),催生了多篇关于亚洲国家工作强度趋势外推的研究。同时,该数据也常作为验证性指标,被整合进更庞大的亚洲社会经济发展综合数据库(如World Bank与ILO联合项目),用以校准和对比不同来源的工时估算,推动了跨国劳动统计在方法论层面的衔接与创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务