遇见数据集

electricsheepasia/asia-ilo-how-uemp-sex-nb-mean-weekly-hours-usually-worked-per-employed-pers

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲35个国家从1999年至2025年按性别划分的就业人员平均每周通常工作时间的720个观测值,涵盖1个核心指标(HOW_UEMP_SEX_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并筛选亚洲国家代码,经过ILO的统计标准化处理。数据集包括国家、数据来源、指标、性别、年份、观测值等字段,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并包含数据质量说明,如使用ILO选择的最佳来源,以及按性别分列的维度。

This dataset contains 720 observations of mean weekly hours usually worked per employed person by sex across 35 Asia countries, spanning 1999–2025, covering 1 distinct indicator (HOW_UEMP_SEX_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled via API and filtered to Asia ISO3 country codes, with harmonization using ICLS definitions. It includes columns such as country code, country name, source, indicator, sex, time, observed value, and is suitable for tabular classification, regression, and time-series forecasting tasks. Data is annual frequency, with quality notes like the use of ILO-selected best source and disaggregation by sex dimensions.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-uemp-sex-nb-mean-weekly-hours-usually-worked-per-employed-pers 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口(https://rplumber.ilo.org/data/indicator?id=HOW_UEMP_SEX_NB)直接抽取原始数据,并依据亚洲ISO3国家代码进行地理过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收支调查及行政记录等微观数据进行统一协调与标准化处理,数据集中的source.label字段保留了数据来源的追溯信息,以确保数据质量的透明性。最终由Electric Sheep Asia团队重新封装为HuggingFace数据集格式。
特点
该数据集收录了1999年至2025年间亚洲35个国家的720条观测记录,聚焦于“按性别划分的受雇人员平均每周通常工作小时数”这一核心指标。数据按性别维度进行细分,包含总计(SEX_T)、男性(SEX_M)和女性(SEX_F)三个类别,便于开展性别视角的劳动时间分析。每个观测值均附有观测状态标志(如序列中断)和来源注释,为数据质量的评估提供了关键线索。此外,数据集囊括了从塞浦路斯(78行)到阿拉伯联合酋长国(18行)等覆盖范围广泛的国家,时间跨度长达二十余年,为亚洲区域劳动市场的纵向比较研究奠定了坚实基础。
使用方法
研究者可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,如使用`ds = load_dataset("electricsheepasia/asia-ilo-how-uemp-sex-nb-mean-weekly-hours-usually-worked-per-employed-pers")`将数据集转换为Pandas DataFrame以便进行后续分析。针对特定国家的分析,可通过`ref_area`列(如“IDN”表示印度尼西亚)进行筛选。对于时间序列建模,可对某一指标按年份排序并绘制观测值的变化趋势。此外,利用pivot_table方法可将数据重塑为国家×年份的矩阵形式,便于开展面板数据分析或构建回归模型。数据集的年度频率和标准化的模式设计使其能无缝接入机器学习流水线。
背景与挑战
背景概述
在全球劳动力市场研究中,工时指标是衡量经济发展、劳动权益与性别平等的重要标尺。国际劳工组织(ILO)自1919年成立以来,始终致力于通过标准化统计框架推动全球劳动数据的可比性与透明性。ILOSTAT数据库作为该领域的权威数据源,整合了来自200余个经济体的劳动统计数据,为跨国比较与可持续发展目标(SDG)的监测提供了坚实基础。在此背景下,Electric Sheep Asia于2025年对ILOSTAT中“按性别划分的就业人员平均每周通常工作时间”指标进行了系统化重组织,构建了覆盖35个亚洲国家、跨越1999至2025年的时序数据集。该数据集聚焦亚洲区域,旨在弥合高精度全球数据与区域级实证研究之间的鸿沟,为劳动经济学、性别研究及政策评估提供了至关重要的量化资源。其核心贡献在于以统一的ISO3代码与标准化字段格式,将原本分散的官方调查数据转化为可直接用于机器学习与统计分析的高质量面板数据,进而推动亚洲劳动力市场动态变化与性别差异的深入理解。
当前挑战
该数据集所应对的核心挑战包括多重层面。在领域问题层面,亚洲各国劳动力市场存在显著的统计口径差异与数据不连续性;许多国家采用不同的调查方法(如劳动力调查、住户收入调查),且ILO优先选用“最佳来源”时可能导致不同年份间序列断裂(如注释中的‘Break in series’标记),直接影响了跨国与跨时段的可比性分析。此外,性别维度的原始数据常因样本量限制或调查覆盖不足而缺失,使得系统性地评估女性就业者的工时变化愈发困难。在数据构建过程中,技术挑战同样突出:ILOSTAT原始API返回的庞大多维数据需经大量的清洗、过滤与格式统一,包括将性别分类(SEX_T/SEX_M/SEX_F)、来源编码与注释标签等非结构化信息转化为规整的表格架构;同时,对35个国家从1999至2025年间的数据一致性验证(如避免不同年份的数据源冲突、移除低质量观测值)需要严谨的数据公证机制。最终,该数据集通过标准化Schema、提供可追溯的来源标签与状态标记,为研究人员在实际应用中识别并应对这些挑战提供了必要的基础设施。
常用场景
经典使用场景
在劳动经济学与跨国比较研究领域,该数据集是分析亚洲各国就业者周平均工作时长与性别关系的基础资源。研究者可利用其覆盖35个国家、横跨1999至2025年的面板数据,构建混合效应模型或面板数据回归,考察经济发展阶段、文化规范与公共政策对工作时长性别差异的影响。同时,该数据支持时间序列分析,用于探究金融危机、新冠疫情等外部冲击如何改变亚洲劳动力市场的工时结构。
解决学术问题
该数据集有效填补了亚洲区域标准化、性别细化工时数据的空白,解决了以往研究中因数据零散、定义不统一而难以进行跨国比较的痛点。它使得学术工作得以精确量化性别工时差异的长期趋势,检验人力资本理论、歧视经济学以及性别角色分工假说在亚洲语境下的适用性。这些洞见对于揭示劳动市场中隐形的不平等机制、评估国际劳工组织体面劳动目标的实现进展具有至关重要的理论意义,并为各国制定缩小性别差距的就业政策提供了实证依据。
衍生相关工作
该数据集的发布推动了多项衍生研究工作的开展。在方法论层面,学者们基于其长时序、多国结构,开发了更稳健的缺失数据插补技术,以应对ILOSTAT中不连续的观测值。在学术产出上,它催生了一系列关于亚洲经济体女性无酬劳动与有酬工时关联性的实证分析,以及利用机器学习方法预测特定国家工时向全球均值收敛速度的研究。这些工作不仅验证了ILO统计框架在区域研究中的适用性,也为后续构建包含更多维度的亚洲劳动力市场一体化数据库奠定了范式基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务