遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲32个国家从1997年至2025年的员工平均每周实际工作小时数数据,按性别、职业和受教育程度进行细分。数据集共有158,754个观测值,涵盖1个核心指标(HOW_XEES_SEX_OCU_EDU_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过劳动力量调查、家庭收入调查等原始数据经国际劳工统计学家会议定义进行标准化处理。数据集以表格形式呈现,包括国家代码、年份、观测值、数据来源、分类变量(如性别、职业、教育水平)及质量注释等列,适用于表格分类、回归和时间序列预测等任务。数据以CC-BY-4.0许可发布,由Electric Sheep Asia重新打包,便于机器学习使用。

This dataset contains mean weekly hours actually worked per employee in 32 Asian countries from 1997 to 2025, disaggregated by sex, occupation, and education level. It includes 158,754 observations covering one core indicator (HOW_XEES_SEX_OCU_EDU_NB), sourced from the International Labour Organizations (ILO) ILOSTAT database, which harmonizes raw data from labor force surveys, household income surveys, and administrative records using International Conference of Labour Statisticians definitions. The data is presented in tabular format with columns for country codes, year, observed values, data sources, classification variables (e.g., sex, occupation, education), and quality notes, suitable for tasks such as tabular classification, regression, and time-series forecasting. Released under the CC-BY-4.0 license and repackaged by Electric Sheep Asia for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Asia团队从ILOSTAT REST API直接抽取并过滤至亚洲地区的ISO3国家代码后重新打包而成。原始数据整合自各国劳动力调查、家庭收入调查、机构调查及行政记录,并依据国际劳动统计学家会议(ICLS)定义进行标准化处理。数据集以Parquet格式发布,确保机器学习场景下的高效加载与调用。
使用方法
使用者可通过HuggingFace Datasets库中的load_dataset()函数一键加载该数据集,并利用Pandas进行后续分析。典型操作包括按国家代码筛选以进行国别聚焦研究,按时间序列排序以观察特定指标的历史演变趋势,或通过透视表构建国家×年份的数据矩阵,便于开展跨国比较。数据集以整洁的表格形式存储,列结构清晰,支持直接进行回归分析、分类建模及时间序列预测等下游任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,并由Electric Sheep Asia于2025年重新打包发布,聚焦于亚洲地区1997年至2025年间劳动者每周实际工作小时数的性别、职业及教育层次细分。数据集源自ILOSTAT——全球劳动统计权威数据库,整合了32个亚洲国家的158,754条观测记录,核心研究问题在于通过高分辨率的分层数据揭示亚洲劳动力市场中工作时间模式的异质性。该数据的发布为劳动经济学、社会政策研究及国际比较提供了标准化、机器可读的基准资源,尤其推动了关于亚洲新兴经济体与转型国家工作条件、性别平等及教育回报率等议题的量化分析。
当前挑战
该数据集所面对的领域挑战在于,亚洲各国劳动力调查体系差异显著,原始数据在抽样方法、调查频率、职业与教育分类标准上缺乏统一性,导致跨国家与跨时期比较时需应对数据口径不一致的问题。构建过程中,团队需从ILOSTAT的REST API中提取指标并过滤至亚洲国家,面临如何调和ILO提供的‘最佳来源’标志与多源数据冲突的难题,同时需处理因方法论修订、非标准教育层次及观测值可靠性标志(如‘不可靠’状态)带来的噪声。此外,极端值、缺失值及时间序列断点进一步增加了数据清洗与建模的复杂性。
常用场景
经典使用场景
在劳动经济学与人口统计学研究中,该数据集被广泛用于分析亚洲各国不同性别、职业与教育背景雇员的平均周工作小时数差异。研究者通过时间序列数据揭示各国劳动市场的结构性变迁,例如女性劳动参与率提升对工时分布的影响,或教育水平与工作时长之间的倒U型关系。此外,该数据集支持跨国比较面板回归,以检验劳动力市场制度(如最低工时立法、产假政策)对工时模式的调节效应。
解决学术问题
该数据集解决了亚洲地区劳动统计碎片化与可比性不足的学术瓶颈,为验证经济学经典假说(如人力资本理论、性别工资差距的工时解释)提供了标准化实证基础。其跨年度、跨国家的分层设计使得研究者能够量化职业隔离与教育回报率在工时决定中的作用,并控制未被观测的异质性。数据集所附带的ILOSTAT方法论注释(如来源标识与断点标记)也显著提升了计量模型的内生性处理能力。
实际应用
在实际应用中,该数据集服务于国际劳工组织与各国劳动部门的政策制定流程。例如,通过追踪低技能女性雇员的工时波动,政策分析者可评估最低工资政策或职业培训项目的实施效果。跨国企业的人力资源部门也利用该数据调整亚洲分支机构的合规性设定(如工时上限),以匹配当地劳动法要求。同时,可持续发展目标(SDG 8.5)中关于体面工作的指标监测亦依赖此类高稀疏性分层数据。
数据集最近研究
最新研究方向
在当前全球劳动力市场深刻变革的背景下,该数据集聚焦于亚洲32国1997至2025年间雇员周均实际工作时间的多维异质性分析,成为劳动经济学交叉研究的核心枢纽。前沿探索已突破传统均值比较的局限,转向性别、职业与教育三重维度的交互效应建模,以捕捉亚洲新兴经济体在工业化与服务业转型中工时结构的非均衡演化。尤其在后疫情时代的灵活用工浪潮与数字平台经济崛起中,研究者借助此数据深入剖析技能分层如何重塑不同性别群体的劳动力供给弹性,以及教育回报率与工作强度间的非线性关联。数据集时间跨度覆盖亚洲金融危机至新冠疫情后的完整周期,为检验非正规就业扩张、人口红利消退及全球化退潮等热点命题对劳动时间配置的冲击提供了纵向解剖的量化基石,其跨国务工流动的隐秘线索更折射出区域内劳动力市场的一体化张力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务