遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-ocu-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲17个国家(如柬埔寨、以色列、印度尼西亚等)从1997年至2024年的2,838个观测值,专注于按性别、职业和残疾状况划分的雇员实际每周平均工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API提取并过滤为亚洲国家。数据集采用表格格式,包含国家代码、来源、指标、性别分类、时间、观测值等列,适用于表格分类、回归和时间序列预测任务。数据以年度频率提供,并包含数据质量标志和注意事项,如来源选择和分类列的非空条件。数据集由Electric Sheep Asia重新打包,以提供统一的机器学习就绪数据层。

This dataset contains 2,838 observations across 17 Asia countries (e.g., Cambodia, Israel, Indonesia) from 1997 to 2024, focusing on mean weekly hours actually worked per employee by sex, occupation, and disability status. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, extracted via REST API and filtered to Asia country codes. It is in tabular format with columns such as country code, source, indicator, sex classification, time, observed value, etc., suitable for tabular classification, regression, and time-series forecasting tasks. The data is provided at annual frequency and includes data quality flags and caveats, such as source selection and non-null conditions for disaggregation columns. The dataset is repackaged by Electric Sheep Asia to offer a unified, ML-ready data layer.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-ocu-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口直接抽取原始数据,并依据亚洲ISO3国家代码进行地域筛选后整合而成。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、住户收入调查等微观数据进行统一协调与标准化处理,最终形成涵盖性别、职业及残疾状况等多维度分类的周平均实际工时指标。数据经Electric Sheep Asia团队重新封装,以Parquet格式发布,便于机器学习工作流直接调用。
特点
数据集包含2,838条观测记录,覆盖1997年至2024年间17个亚洲国家的单一核心指标——按性别、职业和残疾状况划分的雇员周平均实际工作小时数。数据呈现多维度分层结构,可通过性别(男性、女性及总体)、职业技能等级及残疾状态等分类变量进行精细的交叉分析。数据来源的追溯性通过source.label字段得以保障,观测值还附带质量状态标识(如临时性或不可靠性),确保用户能够审慎评估数据可信度。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并转化为pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定国家的子集、按时间序列绘制指标变化趋势,或利用pivot_table构建国家-年份矩阵进行跨国比较。数据以年频率发布,用户需注意部分指标可能存在季度或月度版本,且当同一国家年份存在多个数据源时,采用ILO选定的‘最佳来源’。建议在使用时引用原始ILO数据源及Electric Sheep Asia的重新封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)下属ILOSTAT数据库整理,并于2024年由Electric Sheep Asia重新打包发布,聚焦于亚洲17个国家1997至2024年间按性别、职业与残疾状态划分的雇员平均每周实际工时数据。作为全球劳动统计的权威来源,ILOSTAT基于国际劳动统计学家会议定义,对各国劳动力调查、家计调查等原始微观数据进行统一协调,其指标被广泛用于监测体面劳动与可持续发展目标。这一数据集的发布填补了亚洲地区工时研究中跨性别与残疾维度系统性数据的空白,为劳动经济学、社会政策与可持续发展研究提供了基础性资源,尤其为分析不同人群在劳动力市场中的参与模式与工作强度差异提供了关键支撑。
当前挑战
数据集所应对的核心挑战在于亚洲区域内劳动统计数据的碎片化与可比性缺失:各国调查方法、定义口径及时间跨度差异巨大,导致跨国家、跨时期的系统比较难以实现。ILOSTAT通过统一协调标准解决了微观数据层面的可比性问题,但数据构建中仍面临多重障碍——部分国家的观测值存在断点、方法修订或可靠性标记(如U标记),且少数国家样本量有限(如黎巴嫩仅42条),使得时间序列分析的稳健性受到制约。此外,残疾状态与职业分类维度的数据稀疏性,以及部分细分群体(如女性残疾工人)观测值过少,限制了多维交叉分析的可能性。
常用场景
经典使用场景
该数据集汇聚了1997至2024年间亚洲17个国家按性别、职业和残疾状况分层的雇员周均实际工时数据,是劳动经济学、社会分层与包容性发展研究领域中不可多得的精细量化资源。研究者常将其用于构建面板数据模型,以分析工时在不同人口群体间的分布规律与演变趋势。例如,通过性别与职业交叉维度,可系统揭示女性在何类职业中面临更长的隐性劳动时间,或残疾群体在技能层级中遭遇的工时壁垒。结合观测状态标识与连续性断点注释,该数据还能支撑关于统计方法论变化对工时测度影响的稳健性检验。
解决学术问题
该数据集解决了亚洲劳动市场中跨国家、长时段的弱势群体工时可比性数据稀缺这一长期困扰学术界的难题。传统工时统计多聚焦于宏观整体均值,难以支撑对性别平等、残障融合与职业分层等结构性议题的深入剖析。此数据集通过ILOSTAT统一采用的国际劳工统计学家会议定义,对各国调查微观数据进行细粒度调和,使得跨越国界与年代的性别-职业-残疾三维交叉分析成为可能。其学术意义在于为检验人力资本理论中的补偿性工资差异假设、探讨残疾包容性政策对劳动供给的影响效力,以及评估SDG体面工作目标中性别公平维度提供了严格的基础实证支撑。
衍生相关工作
基于该数据集标准化、机器可读的Parquet格式,已有研究工作将其整合进亚洲劳动市场动态的自动化监测管道中,衍生出长短期时序预测模型与异常检测框架。部分学者利用该数据构建了性别-职业-残疾多维张量分解模型,用于预测在未观测年份中特定细分群体的工时潜在趋势。此外,数据集附带的断点与可靠性注释信息,推动了关于调查方法论变更对跨国面板数据一致性影响的计量经济学方法论研究。在表征学习领域,该数据已被用作基准测试集,评估跨文化背景下多模态劳动指标嵌入表示的可迁移性,进而促进了劳动统计与机器学习的交叉学科发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务