遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-est-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含按性别、企业规模和残疾状况分类的亚洲就业人员平均每周实际工作时间数据,来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集覆盖14个亚洲国家,时间跨度为2007年至2024年,共包含1,662个观察值。数据以年度频率收集,涉及唯一指标“HOW_TEMP_SEX_EST_DSB_NB”,该指标衡量就业人员平均每周实际工作时间,并按性别(总计、男性、女性)、企业规模(总计)和残疾状况(总计)进行细分。数据集提供了国家代码、来源信息、观测值、时间年份等列,适用于表格分类、回归和时间序列预测等任务。数据经过标准化处理,由Electric Sheep Asia重新打包发布,采用CC-BY-4.0许可证。

This dataset contains mean weekly hours actually worked per employed person by sex, establishment size, and disability status in Asia, sourced from the International Labour Organizations (ILO) ILOSTAT database. It covers 14 Asian countries from 2007 to 2024, with 1,662 observations. The data is collected annually and focuses on a single indicator HOW_TEMP_SEX_EST_DSB_NB, which measures average weekly hours worked, disaggregated by sex (total, male, female), establishment size (total), and disability status (total). The dataset includes columns such as country codes, source information, observed values, and time years, and is suitable for tabular classification, regression, and time-series forecasting tasks. It has been repackaged by Electric Sheep Asia and is released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-est-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,经由Electric Sheep Asia团队从REST API直接拉取原始指标数据,并依据亚洲ISO3国家代码进行地理范围筛选后重新封装而成。ILOSTAT本身依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收支调查及行政记录等原始微观数据进行标准化处理,确保跨国比较的严谨性。最终数据集以表格形式呈现,涵盖14个亚洲国家、1662条观测记录,时间跨度从2007年至2024年,聚焦于“按性别、企业规模和残疾状况划分的受雇人员实际周均工作时间”这一核心指标。
特点
此数据集最显著的特点在于其多维度的精细分类架构,横跨性别(男性、女性及总计)、企业规模以及残疾状态三大维度,为剖析亚洲劳动力市场的结构性特征提供了罕见的微观视角。所有指标均采用ILO官方推荐的标准化编码体系,辅以详尽的元数据标签,如数据来源、观测状态标志及注释信息,极大增强了数据的可追溯性与可信度。此外,数据集已处理为年度频率,并选用ILO认可的“最佳来源”消除同一国家年份的多源歧义,兼顾了数据规模的精简与研究用途的可靠性。
使用方法
研究者可通过HuggingFace Datasets库以一行命令轻松加载数据:`load_dataset("electricsheepasia/asia-ilo-how-temp-sex-est-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per")`,并迅速转换为Pandas DataFrame进行深入分析。典型操作包括按国家代码筛选特定国家的时间序列、依据`indicator`列对单一指标进行时序绘图,或利用`pivot_table`构建国家×年份的观测值矩阵,以支持横截面比较与面板数据分析。数据集的列结构清晰,包含国家、来源、指标、性别、分类变量、年份及观测值等关键字段,便于直接应用于分类、回归或时间序列预测等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司基于ILOSTAT数据库整理,经Electric Sheep Asia于2024年重新打包发布,聚焦亚洲14个国家2007至2024年间按性别、企业规模和残疾状况划分的受雇人员平均每周实际工作时长。作为劳动经济学与时间利用研究的关键指标,工作时长数据对于评估劳动力市场效率、工作生活质量及可持续发展目标(SDG 8)的进展具有不可替代的价值。ILO通过协调各国劳动力调查数据并遵循国际劳工统计学家会议(ICLS)定义,确保了跨国可比性,而该数据集在此基础上进一步聚焦亚洲区域,填补了发展中国家微观劳动统计在机器学习领域的结构化数据空白,为区域劳动力市场对比分析及预测建模提供了可靠基础。
当前挑战
该数据集面临的核心挑战之一在于劳动统计领域长期存在的跨国数据可比性问题,不同国家在调查方法、问卷设计、参考期定义及抽样框上存在差异,即便经过ILO协调,部分观测值仍带有‘不可靠’或‘临时性’状态标签,影响模型训练的稳定性。此外,数据集仅包含1662条观测值且覆盖国家有限,多数国家年度数据稀疏或存在时间断层,如2022年仅孟加拉国与巴基斯坦有记录,这使得时间序列预测或跨区域泛化任务面临严重样本不足与缺失值处理的难题。构建过程中,从多来源异构调查中提取并统一分类维度(如企业规模类别与残疾状态定义)亦需大量人力介入,自动化清洗与对齐的难度较高。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集最为经典的应用场景在于构建跨国面板数据以分析亚洲地区劳动者实际工作时间的动态演变。研究人员可借助性別、企业规模及残疾状况等分类维度,揭示不同亚群体在劳动供给上的结构性差异。例如,通过将观察值按国家、年份与性別进行聚合,能够描绘出女性与男性雇员在周均工时上的长期趋势,进而探讨性别不平等与劳动保护政策的关联效应。此外,结合ILO的标准化分类体系,该数据还支持对残疾就业者的工时模式进行精准刻画,为包容性劳动市场研究提供了稀缺的量化基础。
解决学术问题
该数据集有效解决了亚洲劳动统计中跨国比较标准不一与细分数据匮乏等核心学术难题。基于ILOSTAT统一的标准定义,研究者能够规避各国官方统计在工时概念与调查方法上的歧义,从而开展可信度较高的纵向与横向对比分析。具体而言,它使得以下经典问题得以在实证框架中被检验:经济转型时期的工时极化现象、残疾劳动者与正规部门就业的壁垒效应,以及性别划分的劳动力市场弹性。这些成果不仅丰富了发展经济学与劳动经济学的理论库,还通过数据驱动的方式为国际劳工组织推动体面劳动目标提供了实证支撑,显著提升了政策干预的针对性与有效性。
衍生相关工作
该数据集衍生了一系列具有影响力的相关工作,推动了亚洲劳动市场实证研究的方法论创新。其中,基于该数据的典型代表性工作包括:利用时间序列模型预测不同性别群体的工时波动趋势,进而构建区域劳动供给弹性估计;通过生存分析或随机前沿分析探讨企业规模差异如何影响工时调整的敏捷性。此外,部分研究将其与结构性面板模型相结合,解析宏觀经济冲击(如金融危机或疫情)对亚洲各国工时分布的异质性传导路径。这些工作不仅提升了数据集自身的学术可见度,还激发了跨学科协作,例如结合卫星夜间灯光数据或政策文本情感分析,拓展了传统勞動统计在复杂治理环境中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务