遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-eco-ins-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲30个国家从1997年至2025年的员工平均每周实际工作时间数据,按性别、经济活动和公共/私营部门进行细分。数据集共有63,360个观察值,涵盖一个核心指标:HOW_XEES_SEX_ECO_INS_NB(即员工平均每周实际工作时间,按性别、经济活动和公共/私营部门划分)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过标准化处理,并包含国家代码、年份、观测值、数据来源、分类维度(如性别)和质量标志等字段。数据集适用于表格分类、回归和时间序列预测等任务,旨在为亚洲劳动力市场研究提供机器学习就绪的数据。

This dataset contains mean weekly hours actually worked per employee across 30 Asia countries from 1997 to 2025, disaggregated by sex, economic activity, and public/private sector. It comprises 63,360 observations and focuses on one key indicator: HOW_XEES_SEX_ECO_INS_NB (Mean weekly hours actually worked per employee by sex, economic activity and public/private sector). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), normalized, and includes fields such as country codes, year, observed values, data sources, classification dimensions (e.g., sex), and quality flags. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, designed to provide machine learning-ready data for labor market research in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-eco-ins-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API直接提取了指标“HOW_XEES_SEX_ECO_INS_NB”的原始数据,并依据亚洲ISO3国家代码进行地理范围过滤。数据经ILO基于国际劳工统计学家会议(ICLS)定义进行统一化处理,原始调查微观数据来源在“source.label”列中予以标注,确保了数据溯源的可信性与可追溯性。最终由Electric Sheep Asia团队整合为Parquet格式,发布在HuggingFace平台,实现了即用型的数据封装。
特点
该数据集包含63,360条观测记录,覆盖1997至2025年间30个亚洲国家,聚焦于“按性别、经济活动及公共/私营部门划分的雇员平均每周实际工作小时数”这一核心指标。其特色在于丰富的维度分解能力,提供了性别、经济活动分类及机构部门分类等多层次细分字段,支持从宏观平均到微观分组的灵活分析。同时,数据集附带观测状态标记和系列中断注释,为数据质量评估与时间序列分析提供了关键参考信息。
使用方法
使用者可借助HuggingFace的`datasets`库通过`load_dataset()`函数一键加载数据,并转换为Pandas DataFrame进行后续操作。典型应用包括按国家代码筛选特定国家的子集,或按指标排序后绘制时间序列趋势图。此外,可利用透视表功能将数据重塑为国家×年份的矩阵格式,便于进行跨国的长时间序列对比分析。该数据集为劳动经济学研究、政策评估及区域劳动力市场监测提供了标准化的数据基础。
背景与挑战
背景概述
在全球劳动力市场研究领域,工时数据是评估劳动强度、经济效率与职业健康风险的核心指标。国际劳工组织(ILO)作为劳动统计的权威机构,其ILOSTAT数据库汇集了来自200多个经济体的标准化劳动数据,然而区域级别的高频次、多维分类型数据仍缺乏系统整合。在此背景下,Electric Sheep Asia于2025年重新打包发布了亚洲地区周均实际工时数据集,涵盖30个国家1997–2025年间63,360条观测值,按性别、经济活动与公私部门进行精细划分。该数据集旨在弥合宏观劳动统计与微观计量分析之间的鸿沟,为亚洲劳动经济学、可持续发展目标(SDG)8(体面劳动)的量化评估及跨国比较研究提供了统一、可复现、机器学习就绪的数据基础,已在时序预测与分类任务中展现出显著应用潜力。
当前挑战
该数据集所应对的领域挑战在于,亚洲各国因经济结构、劳动力市场监管及统计能力的差异,导致工时数据的可比性与一致性长期不足,尤其是性别与部门维度的交叉分析常因分类标准不统一而受限于粗粒度的聚合结果。构建过程中亦面临多重困难:首先,ILOSTAT原始数据来源庞杂,涵盖劳动力调查、行政记录等多种渠道,需通过ILO的ICLS定义进行跨源协调,并依据‘最佳来源’策略解决同一国家同年份指标的数据冲突;其次,时间序列中存在的不可靠观测值(如暂定或不可靠状态标志)与方法论断裂点(如序列中断)需被准确标注,以避免模型训练中的误导性外推;此外,数据以年频发布,与部分指标的月度或季度细节存在信息损失,且分类维度中的缺省值增加了下游特征工程的复杂性。
常用场景
经典使用场景
该数据集收录了1997至2025年间30个亚洲国家按性别、经济活动及公共/私营部门划分的雇员实际周平均工时数据,共计63,360条观测记录。在劳动经济学与统计学领域,它常用于构建面板数据模型,分析亚洲各国劳动供给的时间演变趋势,或通过分解性别、行业及所有制维度,揭示工时差异的结构性特征。研究者可借助时间序列预测方法,基于历史观测值对未来的工时水平进行推演,为区域劳动力市场的动态监测提供量化依据。
衍生相关工作
该数据集衍生了多种经典研究工作。一方面,基于ILOSTAT衡量的工时数据,已有研究构建了亚洲国家劳动供给的长期面板数据库,进而分析经济周期对工时波动的异质性影响。另一方面,通过引入性别与行业分类,衍生出一系列关于性别工时差距收敛速度及公共部门就业保护效果的定量评估模型。此外,结合气候、教育等其他宏观指标,研究者开发出多变量预测框架,用于估算未来劳动力市场的结构调整方向,拓展了原数据在跨学科中的应用边界。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区雇员实际周均工作时间的性别、经济活动与公私部门交叉分析,为劳动经济学与可持续发展研究提供高粒度时序面板数据。当前前沿方向包括:其一,基于1997–2025年覆盖30国的长周期观测,揭示后疫情时代亚洲非正规就业与性别工时差距的演变轨迹,为ILO体面劳动目标(SDG 8)的区域化监测提供量化支撑;其二,结合ILOSTAT统一分类体系,探索制造业与服务业工时灵活性对生产率及工作贫困的异质性影响,助力跨国比较中克服调查方法断点(如I11:264标注的方法修订)造成的统计偏差。该数据对亚洲劳动力市场弹性、性别平等政策评估及超时劳动规制研究具有基准意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务