遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-eco-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲地区员工实际每周平均工作小时数的统计数据,按性别、经济活动和残疾状况分类。数据覆盖17个亚洲国家,时间跨度为1997年至2024年,共包含7,900个观测值。数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API提取并过滤到亚洲国家。指标为HOW_XEES_SEX_ECO_DSB_NB,表示按性别、经济活动和残疾状况分类的员工实际每周平均工作小时数。数据字段包括国家代码、来源、指标、性别分类、经济活动和残疾状况分类、观测年份、观测值等,适用于表格分类、回归和时间序列预测等任务。

This dataset contains statistics on mean weekly hours actually worked per employee in Asia, disaggregated by sex, economic activity, and disability status. It covers 17 Asian countries from 1997 to 2024, with 7,900 observations. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), extracted via REST API and filtered to Asian countries. The indicator is HOW_XEES_SEX_ECO_DSB_NB, representing mean weekly hours actually worked per employee by sex, economic activity, and disability status. The schema includes columns such as country code, source, indicator, sex classification, economic activity and disability status classifications, observation year, and observed value, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-eco-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,由Electric Sheep Asia团队精心整理与封装。原始数据通过ILOSTAT的REST API接口直接采集,指标编码为HOW_XEES_SEX_ECO_DSB_NB,并依据亚洲ISO3国家代码进行地理范围过滤。ILOSTAT自身遵循国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行统一协调与标准化处理,确保跨国可比性。数据集包含7,900条观测记录,覆盖17个亚洲国家,时间跨度从1997年至2024年,所有观测值均标注了来源标签以保障数据溯源的可信度。
特点
该数据集聚焦于每周实际工作小时数这一核心劳动指标,并提供了丰富的维度拆解能力。数据按性别(男性、女性、总计、其他)、经济活动部门以及残疾状况进行分层,形成了高细粒度的多维视角。除核心数值外,每条记录还附带了观测状态标记(如可靠性标识)和注释信息(如序列中断说明),为用户评估数据质量提供了关键依据。数据集以整洁的表格形式呈现,包含20个标准化字段,兼容时间序列分析与横截面比较,尤其适合研究亚洲地区劳动力市场的结构性差异与动态演变。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,仅需一行代码`load_dataset`即可将数据集转化为Pandas DataFrame,快速开展分析。典型用法包括按国家筛选以聚焦特定地区的时间序列,或按指标分组后排序绘制趋势图,直观展示多年变化。对于跨国家比较,可利用数据透视功能将表格重塑为国家×年份的矩阵形式,便于观察区域异同。数据集完全兼容常见的表格分类、回归及时间序列预测任务,其清晰的架构和丰富的元数据标签使得研究人员能够无缝衔接下游建模与分析流程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,经Electric Sheep Asia于2024年重新打包发布至HuggingFace平台,聚焦亚太地区劳动市场中的关键时间利用指标——员工每周实际工作小时数。核心研究问题在于揭示性别、经济活动类别及残疾状况如何影响亚洲17国(1997–2024年间)劳动者的工时分布,为评估体面劳动目标(SDG 8)及包容性就业政策提供量化依据。作为ILOSTAT数据库的子集,该数据依托ILO基于国际劳工统计学家会议(ICLS)定义的统一方法对各国劳动力调查数据进行标准化整合,填补了亚洲区域跨国家-年份-人口细分维度的工时结构化数据空白,对劳动经济学、残疾包容及性别平等领域的实证研究具有重要推动作用。
当前挑战
领域层面,该数据集旨在解决劳动统计中工时指标的多维异质性难题——不同人口细分(性别、残疾状况)及经济活动部门的工时差异常被聚合数据掩盖,难以精确刻画弱势群体(如残疾人、女性)的劳动参与模式。构建过程中面临两大挑战:一是数据来源的异构性,17国数据分别来自各国劳动力调查(LFS)及行政记录,ILO虽通过ICLS定义进行协调,但源数据在问卷设计、抽样方法及观察值可靠性(如标记为“U”不可靠或“断点”的观测值)上仍存在不一致,需依赖“最佳源”选择策略减少偏差;二是时间跨度与地理覆盖的非平衡性,如亚美尼亚(2007–2018年)与孟加拉国(2022–2024年)的观测时段差异显著,且部分国家(如黎巴嫩)仅覆盖单一年份,导致时间序列分析时面临缺失数据与可比性挑战。
常用场景
经典使用场景
在劳动经济学与时间利用研究的广阔领域中,该数据集凭借其横跨1997至2024年、覆盖17个亚洲国家的7,900条观测记录,成为研究者剖析不同性别、经济活动部门及残疾状态雇员平均每周实际工作时长演化规律的核心素材。其最经典的使用场景莫过于构建面板数据模型,通过时间序列与截面维度的双重交织,揭示亚洲各国劳动力市场中工作时长分布的异质性特征,例如对比东亚与南亚国家在制造业或服务业中男女性雇员工作时间的差异,抑或评估残疾状态对劳动供给时间的调节效应。
解决学术问题
该数据集精准回应了长期以来困扰国际劳动统计领域的若干学术难题,尤其是关于残疾人群体的劳动参与数据碎片化以及性别工时差距的跨国比较困境。通过提供按残疾状态与经济活动部门细分的标准化工时指标,它使得研究者能够实证检验‘残疾就业悖论’——即残疾雇员是否因工作内容调整而呈现更短周工时,亦或因保障性就业政策而维持稳定产出。同时,亚洲多国数据的整合为检验经济发展阶段与工时收敛假说提供了坚实底座,推动了关于体面劳动目标(SDG 8)进展的量化评估。
衍生相关工作
围绕这一数据集,学术界与开源社区已经衍生出多项标志性工作。研究者利用其开发了预测亚洲各国未来五年工时趋势的自回归移动平均模型,并基于ILO最佳来源选择方法探索了多源抽样偏差校准算法。在工具层面,Electric Sheep Asia的标准化打包流程降低了跨库调用的技术门槛,催生了诸如‘ILOSTAT-Tabular-View’交互式可视化套件以及基于Transformer的工时序列异常检测基准。这些衍生产品不仅验证了原始数据的可靠性,更将其影响力扩展至自然语言处理与时空数据融合的前沿领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务