遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-ocu-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲地区劳动统计数据,具体指标为按性别和职业划分的就业人员实际平均每周工作小时数(指标代码:HOW_TEMP_SEX_OCU_NB)。数据集涵盖40个亚洲国家,时间跨度为1994年至2025年,共包含18,403个观测值。数据通过ILOSTAT REST API获取,并经过筛选和标准化处理,以表格形式提供,包含国家代码、年份、性别分类、职业分类、观测值及数据来源等详细信息。数据集适用于表格分类、回归和时间序列预测等任务,主要用于劳动经济学、社会政策分析和区域研究。

This dataset contains labor statistics for Asia from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Mean weekly hours actually worked per employed person by sex and occupation (indicator code: HOW_TEMP_SEX_OCU_NB). It covers 40 Asian countries, spanning the years 1994 to 2025, with 18,403 observations. The data is sourced from the ILOSTAT REST API, filtered and normalized, and provided in tabular format with detailed columns including country codes, years, sex disaggregation, occupation classification, observed values, and data sources. The dataset is suitable for tasks such as tabular classification, regression, and time-series forecasting, primarily used in labor economics, social policy analysis, and regional studies.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-ocu-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接获取指标代码HOW_TEMP_SEX_OCU_NB所对应的原始数据,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等微观数据进行统一协调与标准化处理,确保跨国家与跨时期的可比性。数据集中每一观测均标注了来源标识(source.label),以追溯数据出处,从而保障了信息的透明性与可验证性。
特点
该数据集聚焦于亚洲地区,涵盖40个国家自1994年至2025年间共18,403条观测记录,围绕“按性别与职业划分的受雇人员每周实际平均工作小时数”这一核心指标展开。数据按性别(总、男、女、其他)与职业技能水平(OCU_SKILL_TOTAL)进行细致分组,为分析劳动时间的结构性差异提供了丰富的维度。此外,数据集包含观测状态标记(obs_status)与详细注释(note_classif等),有助于用户识别数据质量与潜在偏误,体现了严谨的学术数据管理规范。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,使用`load_dataset`函数即可将数据导入为Pandas DataFrame进行后续分析。典型应用包括按国家筛选以进行国别时序研究,例如过滤`ref_area`为“IDN”即可聚焦印度尼西亚。亦可针对单一指标(如HOW_TEMP_SEX_OCU_NB)按时间排序并绘图,直观呈现变化趋势。为进一步开展面板数据分析,建议将数据按年份和地区进行透视,构建国家×年份矩阵,从而便于进行跨区域比较与计量模型构建。
背景与挑战
背景概述
在全球劳动力市场中,工作时间是衡量劳动者福祉与经济活动效率的核心指标。该数据集由国际劳工组织(ILO)于2025年通过ILOSTAT平台发布,并由Electric Sheep Asia进行整理与标准化封装。其核心研究问题聚焦于亚洲地区按性别与职业分层的劳动者实际周平均工作时间,旨在揭示不同社会经济群体在劳动投入上的差异与演变趋势。数据集覆盖40个亚洲国家,时间跨度从1994年至2025年,共包含18,403条观测记录。作为ILOSTAT劳动统计体系的重要组成部分,该数据为亚洲劳动经济学、性别平等研究以及可持续发展目标(SDG)中体面工作议题的量化分析提供了关键支撑,推动了跨国比较与时间序列研究的深入发展。
当前挑战
数据集所解决的领域问题在于,弥补了亚洲地区按性别与职业细分的劳动工时统计数据的缺失,使研究者能够精准识别不同群体在劳动市场中的参与差异与结构性不平等。然而,在构建过程中面临多重挑战:首先,各国原始调查数据来源不一,涵盖劳动力调查、家庭收入调查与行政记录,数据口径与质量参差不齐,需依赖ILO的国际劳工统计学家会议(ICLS)定义进行协调与标准化处理。其次,时间跨度的不一致性与部分年份观测值的缺失,要求对年度频率数据进行严格质量控制,并标记不可靠观测(如obs_status字段中的'U'值)。此外,职业细分维度(classif1)仅在有对应分类时存在,导致拆分后样本稀疏,增加了统计建模的复杂性与数据推断的难度。
常用场景
经典使用场景
在劳动经济学与区域发展研究中,该数据集是分析亚洲劳动力市场工时特征的基础性资源。研究者常利用其按性别和职业分类的周均实际工时数据,构建面板回归或时间序列模型,以揭示不同社会经济背景下工时模式的差异。例如,通过对比东亚、东南亚与南亚国家间的工时分布,可以探讨工业化进程与劳动供给弹性之间的关联。数据集覆盖1994年至2025年的长周期,支持跨时段的纵向比较,尤其适用于探究金融危机、疫情冲击等外生事件对工时调整的动态影响。此外,其基于ILOSTAT统一标准的元数据设计,确保了跨国产出比较的可信度。
实际应用
在实际政策与企业决策中,该数据集提供了洞察亚洲劳动力市场运行的关键透镜。国际组织如ILO可据此监测成员国在“体面劳动”框架下工时合理性的进展,为制定减少过度劳动的劳动标准提供数据支撑。跨国公司在进行区域布局时,能利用职业与性别分解的工时数据,优化人工成本预算与排班策略,例如识别哪些国家特定职业存在显著的超时工作趋势。此外,保险公司与精算机构可结合工时趋势评估职业健康风险,推算长期劳损或心理压力索赔的概率。数据集的API友好形式也使其能够嵌入实时劳工统计仪表盘,支持政府部门快速响应工时异常波动。
衍生相关工作
该数据集已催生了一系列富有洞见的学术延伸。在面板计量领域,研究者基于其构建了“亚洲工时收敛性”模型,发现中高技能职业的周均工时呈现向40小时标准收敛的迹象。在机器学习方向,有团队利用性别和职业维度作为特征,训练随机森林模型以预测不同国家的工时上限阈值,准确率显著优于单一参数模型。此外,该数据与GDP增长率、性别工资差距等外部数据关联后,衍生出对“劳动时间弹性与经济增长悖论”的再检验,指出部分亚洲国家存在工时下降速度滞后于人均产出增幅的现象。这些工作共同推动了跨学科视阈下劳动市场知识图谱的完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务