遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-eco-est-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲24个国家从2000年至2025年期间,员工平均每周实际工作小时数的统计数据,总计77,350个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了按性别(总计、男性、女性)、经济活动和机构规模分类的详细维度。数据集适用于表格分类、回归和时间序列预测等任务,提供了包括国家代码、时间、观测值、数据来源和质量标志在内的结构化信息,旨在支持劳动市场分析和机器学习应用。

This dataset contains statistical data on the average weekly actual working hours of employees from 24 Asian countries between 2000 and 2025, with a total of 77,350 observations. Derived from the ILOSTAT database of the International Labour Organization (ILO), it covers detailed dimensions categorized by gender (total, male, female), economic activity, and institutional size. The dataset is suitable for tasks such as tabular classification, regression, and time series forecasting, and provides structured information including country codes, time, observations, data sources, and quality flags, aiming to support labor market analysis and machine learning applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-eco-est-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口获取指标HOW_XEES_SEX_ECO_EST_NB的原始数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据筛选聚焦于亚洲地区,基于ISO 3166-1 alpha-3国家代码提取24个亚洲国家的记录,涵盖2000年至2025年间的年度观测。数据来源包括劳动力调查、家庭收入调查、企业调查及行政记录,且通过source.label字段标注了每条数据的溯源信息,确保可追溯性。最终由Electric Sheep Asia团队重新打包为HuggingFace数据集格式,共计77,350条观测。
特点
该数据集的核心特点在于其多维度的分类结构,支持按性别(总、男、女)、经济活动(如广泛部门总计)和企业规模(如总计)进行深入分解。每条记录包含主指标'雇员实际周平均工时',并附有观测状态标志(如临时值、不可靠值)及详细的系列变更注释(如方法修订),为研究人员提供了严谨的数据质量评估依据。数据覆盖24个亚洲国家,时间跨度长达26年,观测数量近8万条,尤为适合进行跨国家、跨行业的劳动工时比较分析及长期趋势的时间序列建模。
使用方法
用户可通过HuggingFace的datasets库轻松加载该数据集,使用`load_dataset`函数即可将数据一键转换为Pandas DataFrame格式,便于后续分析。典型用法包括按国家筛选子集(如过滤`ref_area`为'IDN'的印度尼西亚数据),针对单一指标进行时序排序与可视化,以及利用pivot_table将数据重塑为国家×年份的矩阵格式,以支持面板数据分析。此外,数据集标注了CC-BY-4.0许可证,用户在使用时需同时引用原始ILO数据来源及Electric Sheep Asia的重新打包版本。
背景与挑战
背景概述
在全球劳动力市场研究领域,工作时间指标是衡量经济活跃度、性别平等及劳动权益的关键参数。由国际劳工组织(ILO)统计司管理的ILOSTAT数据库,作为全球劳动统计的权威来源,长期系统性地收集并标准化各国劳动力调查数据。在此背景下,Electric Sheep Asia团队于2025年对ILOSTAT中亚洲地区的核心指标‘按性别、经济活动与机构规模划分的雇员实际周均工作时长’进行结构化重包装,形成了包含24个国家、2000至2025年间的77,350条观测记录的数据集。该数据集聚焦于亚洲这一劳动力结构复杂、经济发展水平差异显著的区域,旨在为跨国比较分析、劳动经济学建模以及可持续发展目标(SDG)中体面工作指标的追踪提供统一、机器可读的数据基础,对区域劳动政策研究与时间序列预测具有重要支撑价值。
当前挑战
该数据集主要面临三重挑战。其一,在领域问题层面,亚洲各国劳动力调查的统计口径、调查方法及数据质量参差不齐,ILOSTAT虽已通过国际劳工统计学家会议(ICLS)定义进行部分标准化,但不同来源的序列仍存在方法修订(如示例中的‘断点’标记)与可靠性差异(如‘obs_status’标记为不可靠值),这给跨国的长期趋势分析与回归模型带来了噪声与偏差处理难题。其二,在构建过程中,数据整合需应对多源异构的挑战,包括处理来自劳动力调查、行政记录等多种渠道的原始数据,并统一性别、经济活动分类等多维度的离散化结构,同时需保留“最佳来源”筛选逻辑以确保数据权威性,这要求精细的溯源标注与冲突解决机制。此外,年度频率与部分国家频繁的年份空缺(如阿富汗、缅甸等数据稀疏地区)限制了时间序列模型的训练连贯性,并增加了对缺失值插补的依赖。
常用场景
经典使用场景
该数据集聚焦于亚洲24个国家2000年至2025年间雇员平均每周实际工作小时数的统计,涵盖性别、经济活动部门及企业规模三个关键维度。经典的学术与政策研究场景包括构建面板回归模型,分析亚洲各国工时变迁趋势及其与经济增长、劳动生产率之间的动态关联;亦可利用时间序列方法预测未来工时变化,为劳动经济学中的效率工资理论或劳动力供给弹性研究提供跨国产据。此外,研究者可通过性别分组检验工时差异的收敛性,探究女性劳动参与率提升与工时结构演变的内在逻辑。
解决学术问题
该数据集精准回应了劳动经济学与发展经济学中的若干核心议题:其一,弥补了亚洲区域工时标准化微观数据的稀缺性,使跨国比较研究摆脱了对零散国家统计的依赖;其二,通过提供按性别与经济活动分类的工时数据,助力揭示劳动力市场中性别不平等的时间维度表现,例如女性在非正规部门或中小型企业中的隐性加班负担;其三,助力检验最低工资政策或劳动保护法规对实际工时的影响,为制度设计提供实证锚点。其影响在于推动了亚洲劳动市场研究的可重复性与数据透明度。
衍生相关工作
围绕该数据集的衍生产出已催生了一系列具有影响力的研究工作。其一,基于ILOSTAT工时指标与经济发展数据融合所构建的亚洲劳动市场面板数据库,成为后续分析产业结构变迁与劳动力再配置效率的标准工具。其二,部分学者利用该数据集的性别和时间维度,训练时间序列预测模型以估计女性劳动供给对经济冲击的响应弹性,推动了性别经济学与宏观计量方法的交叉创新。其三,该数据也被用于验证自动化与数字化对亚洲制造业工时的影响假设,衍生了多篇发表于劳动经济学与发展经济学权威期刊的实证论文。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务