遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-est-mts-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含25,033个观测值,覆盖23个亚洲国家,时间跨度为2000年至2025年,专注于一个指标:按性别、企业规模和婚姻状况划分的员工每周实际平均工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集采用表格格式,包含多个列,如国家代码、年份、指标值、性别分类等,适用于表格分类、回归和时间序列预测等任务。数据经过ILO的标准化处理,确保与ILO统计定义一致,并包含数据质量说明,例如年度频率和最佳源选择。

This dataset contains 25,033 observations across 23 Asian countries from 2000 to 2025, focusing on one indicator: Mean weekly hours actually worked per employee by sex, establishment size and marital status. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered for Asian countries. It is presented in tabular format with columns such as country code, year, indicator value, and sex disaggregation, suitable for tasks like tabular classification, regression, and time-series forecasting. The data is harmonized by ILO using International Conference of Labour Statisticians definitions, with quality caveats including annual frequency and best-source selection.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-est-mts-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,聚焦于亚洲地区雇员周均实际工作时间的多维剖析。通过调用ILOSTAT REST API接口,数据以ISO3国家代码为筛选条件,精准提取了涵盖2000年至2025年间23个亚洲国家的25,033条观测记录。在构建过程中,数据遵循国际劳工统计学家会议(ICLS)的统一定义框架,对原始调查微观数据进行了标准化处理,并通过`source.label`字段标注数据来源,确保每一条记录皆可追溯至具体的劳动力调查或行政记录,从而实现了跨国家、跨时间段的劳动统计数据的科学整合与封装。
特点
此数据集的核心特色在于其精细化的多维度解构能力。它不仅提供了按性别(男性、女性、总计)划分的周均工作时长,还深入结合了企业规模与婚姻状况两个分类变量,形成了`sex`、`classif1`、`classif2`等专业字段,使得研究者能够从社会人口与经济结构的多重视角审视劳动供给模式。数据覆盖了泰国、巴基斯坦、土耳其等劳动市场特征迥异的亚洲经济体,时间跨度长达25年,且通过`obs_status`和`note_indicator`等字段清晰标注了数据的可靠性及方法变更等元信息,为进行严谨的跨国比较与时间序列分析提供了坚实的数据质量保障。
使用方法
使用者可通过HuggingFace Datasets库便捷调用,仅需一行`load_dataset`命令即可将数据加载至Python环境,并轻松转换为Pandas DataFrame进行探索性分析。针对特定国家或单一指标的研究需求,可借助`ref_area`与`indicator`字段实现快速筛选与子集提取。数据格式天然适配时间序列分析范式,通过简单的`pivot_table`操作即可将数据重塑为国家×年份的矩阵形式,便于进行可视化绘图或构建面板数据回归模型。该数据集以其标准化的Parquet存储格式和清晰的Schema设计,大幅降低了劳动经济学研究者的数据预处理门槛,使其能够聚焦于亚洲就业形态与工时变迁的深层洞察。
背景与挑战
背景概述
在劳动力经济学与公共政策研究领域,工作时间的精确测量是评估劳动市场效率、性别平等及经济福祉的核心指标。由国际劳工组织(ILO)统计部门维护的ILOSTAT数据库,作为全球劳动统计的权威来源,通过整合各国劳动力调查与行政记录,提供了跨200多个经济体的可比数据。Electric Sheep Asia团队于2025年基于ILOSTAT REST API构建的数据集,聚焦亚洲23个国家2000至2025年间雇员实际周均工作小时数。该数据集经由性别、企业规模与婚姻状况三个维度进行分解,涵盖25,033条观测值,旨在填补亚洲地区细粒度工时数据的缺口,为跨国比较、时序分析与机器学习建模提供标准化的数据基础。其发布显著提升了ILO官方统计在计算社会科学与数据科学领域的可获取性与适用性,特别在亚洲发展经济学与劳动市场不平等研究中具有重要影响力。
当前挑战
该数据集面临的核心挑战在于解决劳动统计领域长期存在的跨国数据可比性问题。亚洲各国在调查方法(如劳动力调查与行政记录的差异)、时段覆盖不连续(如塔吉克斯坦仅2007-2009年有数据)、以及因方法论修订导致的序列断裂(由`note_indicator.label`字段标识)均构成模型训练与推断的系统性偏差。此外,数据构建过程中需应对多源数据整合的困难:ILOSTAT虽提供'最佳来源'选择机制,但部分国家(如柬埔寨与越南)仅少数年份有记录,样本稀疏性限制了深度学习模型的有效训练。分类维度的非完备性(如`classif1`与`classif2`仅在有分解值时才非空)要求研究者谨慎处理缺失结构,而年度频率的粗糙粒度难以捕捉月度或季度波动,在时间序列预测任务中引入了额外的噪声与不确定性。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中亚洲23个国家从2000年至2025年间,按性别、企业规模及婚姻状况分层统计的员工周均实际工作工时数据,共计25033条观测记录。作为典型的时序面板数据,其最经典的应用场景聚焦于劳动经济学领域的跨国比较研究,学者可借助该数据集系统剖析亚洲各国劳动力市场的工时演变规律,例如绘制不同性别劳动者周均工时的长期趋势曲线,或对比不同企业规模下员工工作强度的差异化特征。
衍生相关工作
基于该数据集所衍生的经典工作主要集中于劳动力市场分层建模与劳动政策影响评估两大方向。研究者常将其与ILOSTAT中的工资、失业率等其他指标进行横向融合,构建多维度劳动市场监测面板,进而运用固定效应模型或空间计量方法,探究亚洲国家工时标准化进程中的制度趋同现象。此外,部分工作通过时间序列预测模型,利用该数据预判未来数年亚洲女性劳动力参与率与工时分配格局的演变趋势,为国际组织制定体面劳动议程提供了可量化的前瞻分析工具。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲23国2000-2025年间按性别、企业规模及婚姻状态划分的员工周均实际工作时长,为劳动经济学与时间利用研究提供了高分辨率面板数据。当前前沿方向包括:结合ILO体面劳动议程,利用该数据量化亚洲各国非正规就业与性别工时差距的时空演变,并关联COVID-19疫情对劳动力市场的异质性冲击;借助其细粒度分类属性,探索企业规模与婚姻状态如何交互影响劳动供给决策,为亚洲新兴经济体制定弹性工时政策提供实证依据。数据经ILOSTAT标准化处理并整合为ML-ready格式,为时序预测与因果推断研究奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务