遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-age-eco-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格型数据集,专注于亚洲地区就业人员的工作时间统计。它包含了33个亚洲国家从1997年至2025年间共计336,856条观测数据,核心指标为按性别、年龄和经济活动划分的就业人员实际平均每周工作时间。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,涵盖了就业、工作时间等劳动统计主题。数据集提供了按国家、年份、性别(总计、男性、女性、其他)、年龄组和经济活动部门等多维度细分的数据,可用于分类、回归或时间序列预测等机器学习任务。数据以规范化模式存储,包含国家代码、指标代码、观测值、数据来源和质量标志等字段。

This dataset is a tabular dataset focusing on working hours statistics for employed persons in Asia. It contains 336,856 observations across 33 Asian countries spanning the years 1997 to 2025, with the core indicator being Mean weekly hours actually worked per employed person by sex, age and economic activity. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering labor statistics topics such as employment and working time. The dataset provides multi-dimensional disaggregation by country, year, sex (total, male, female, other), age group, and economic activity sector, making it suitable for machine learning tasks like tabular classification, regression, or time-series forecasting. The data is stored in a normalized schema including fields for country codes, indicator codes, observed values, data sources, and quality flags.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-age-eco-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接获取指标代码为HOW_TEMP_SEX_AGE_ECO_NB的原始数据,并依据亚洲国家ISO3代码进行地理区域筛选。数据经过ILO基于国际劳工统计学家会议(ICLS)定义的标准进行统一协调与清洗,原始调查微观数据来源在source.label字段中予以标注,确保了数据的可追溯性与国际可比性。来自Electric Sheep Asia团队对原始数据进行了重新封装与标准化处理,最终形成包含336,856条观测记录的表格型数据集。
使用方法
用户可通过HuggingFace datasets库的load_dataset()函数一键加载数据集,返回的DataFrame可直接转换为Pandas格式进行后续操作。支持按国家代码(ref_area)筛选特定国家数据,或按指标代码过滤以聚焦于周工作小时指标。利用pivot_table方法可轻松构建以年份为行、国家为列的观测值矩阵,适用于面板数据分析与时间序列建模。数据集还兼容时间序列预测任务,可基于obs_value列进行趋势分析与模型训练,极大降低了劳动经济学研究的数据获取门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)创建,经Electric Sheep Asia于2025年重新整理并发布在HuggingFace平台上,聚焦于亚洲33个国家1997至2025年间按性别、年龄和经济活动划分的就业人员每周实际平均工作小时数。作为ILOSTAT数据库的核心子集,该数据源汇集了来自劳动力调查、家庭收入调查及行政记录等多源数据,旨在系统揭示亚洲劳动力市场的工作时间分布格局。其研究问题核心在于通过高颗粒度的分类维度,为劳动经济学、社会政策及可持续发展目标中的体面劳动指标提供量化支撑,尤其在亚洲经济快速转型与人口结构变迁的背景下,该数据集对理解地区间劳动强度差异、性别不平等及行业异质性具有重要学术与政策价值。
当前挑战
该数据集面临的核心挑战包括:1)所解决的领域问题方面,亚洲各国劳动统计数据的采集标准、质量与频次差异显著,部分国家存在数据缺失或统计口径不一(如非正规就业覆盖不足),导致跨区域比较与时间序列分析时需处理异质性与偏差;此外,性别与年龄细分维度在部分年份或国家存在缺失,阻碍了对女性劳动力参与及青年就业状态的深入剖析。2)构建过程中,数据整合需从ILOSTAT的海量多源数据中筛选亚洲子集,并应对来源标注(如'best source'选择)、观测状态标志(如'不可靠'值)及分类变量非空约束等复杂逻辑,同时需确保33个国家不同年份数据在统一Schema下的一致性,这对数据清洗与标准化流程提出了较高要求。
常用场景
经典使用场景
在劳动经济学与统计学的交叉研究中,该数据集常被用于构建和验证预测模型,如利用时间序列分析探究亚洲各国不同性别、年龄及经济活动群体的周平均实际工作时长演变趋势。研究者可借助该庞大规模的数据(逾33万条观测)进行分类与回归任务,揭示工作时长的分布特征及其与宏观经济变量的关联,为区域就业质量评估提供量化基石。
解决学术问题
该数据集有效缓解了亚洲地区劳动统计碎片化与可比性不足的学术困境,为跨国跨时期的工时研究提供了标准化、细颗粒度的面板数据。它使得学者得以系统剖析性别平等、代际差异及产业结构变迁对工作时长的影响,从而推动关于体面劳动、社会保障及可持续发展目标中就业指标的理论实证研究,深化对亚洲劳动力市场运行规律的理解。
实际应用
在实际应用中,该数据集被国际组织、政府部门及研究机构用于监测亚洲各国的就业状况与劳工权益进展。政策制定者可据此评估不同群体(如青年、女性)的工时负担,调整劳动法规与最低工资标准;企业则能结合行业工时基准优化人力资源配置,促进工作与生活的平衡。此外,它也是联合国可持续发展目标中体面劳动指标的重要数据支撑。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别、年龄及经济活动分类的就业者周均实际工时,为区域劳动力市场分析提供了高分辨率时序数据。当前研究前沿正将其与跨国比较中的性别平等议题深度耦合,尤其关注女性的非标准就业与工时差异。结合ILOSTAT的权威统计与Asia范围的33国覆盖,数据集可支撑劳动力弹性与自动化冲击的时空建模,为后疫情时代亚洲工时极化现象、非正规经济参与率变动及SDG目标8的进展监测提供可靠基座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务