遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-ocu-est-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含37,477个观测值,记录了25个亚洲国家从2000年至2025年期间按性别、职业和企业规模划分的就业人员实际周平均工作小时数的劳动力统计数据。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了性别(总计、男性、女性)、职业分类和企业规模等多个维度的分类信息。数据集以年度频率提供,包含国家代码、数据来源、指标代码、观测值、观测状态等字段,并遵循CC-BY-4.0许可协议。该数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供机器学习就绪的数据层。

This dataset contains 37,477 observations of Mean weekly hours actually worked per employed person by sex, occupation and establishment size across 25 Asia countries, spanning 2000–2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, with disaggregation dimensions including sex (total, male, female), occupation classification, and establishment size. It provides annual frequency data with fields such as country codes, data sources, indicator codes, observed values, and observation status flags. The dataset is released under the CC-BY-4.0 license and repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia on HuggingFace.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-ocu-est-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
在劳动经济学研究中,工时数据是衡量劳动力市场效率与工作条件的关键指标。本数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,通过其REST API直接提取,并筛选出亚洲地区的ISO3国家代码构建而成。原始数据经ILO统计局依据国际劳工统计学家会议(ICLS)定义进行统一协调处理,将各国劳动力调查、家庭收支调查及行政记录等多元微观数据整合为标准化格式。数据集的每一个观测值均附有来源标记(source.label),以确保可追溯性与数据质量。最终,由Electric Sheep Asia团队进行重新封装,生成包含37,477条观测、覆盖25个亚洲国家、时间跨度为2000至2025年的结构化表格数据集。
使用方法
本数据集以Hugging Face Datasets格式发布,可通过load_dataset()函数一键加载,极大简化了数据获取流程。加载后,用户可直接将训练集转换为Pandas DataFrame进行探索性分析。针对特定国家或特定指标,可运用条件筛选与排序功能提取所需子集,例如通过过滤ref_area字段聚焦印度尼西亚的工时数据。对于时间序列分析,可基于indicator字段对观测值按年份排序并可视化。此外,利用pivot_table方法可便捷地将数据重塑为国家×年份的矩阵形式,为构建面板模型或执行跨国产出比较提供直接基础。
背景与挑战
背景概述
在劳动经济学与亚洲发展研究的交汇领域,精确的工时数据是评估劳动力市场效率、性别平等及经济政策效果的关键指标。由国际劳工组织(ILO)统计司创建并于2025年发布的该数据集,依托其核心数据库ILOSTAT,汇集了2000年至2025年间25个亚洲国家的37,477条观测值,涵盖按性别、职业及企业规模划分的周均实际工时。作为ILO跨国劳动统计体系的重要组成部分,该数据集基于国际劳工统计学家会议(ICLS)标准对各国劳动力调查数据进行统一协调,旨在解决亚洲地区因数据源分散、指标口径不一而导致的区域比较难题。其经Electric Sheep Asia重封装后,以机器学习就绪的表格形式呈现,为研究者提供了高颗粒度的时间序列数据,推动了亚洲劳动市场比较研究、性别差异分析及统计方法论的实证检验。
当前挑战
该数据集面临的核心领域挑战在于亚洲多国劳动力市场的结构性异质性:不同国家的行业构成、非正规经济比重及劳动力调查覆盖范围差异显著,导致跨域比较时需审慎处理统计口径偏差;同时,性别、职业与规模维度的交叉分类虽增强了分析深度,却因部分发展中国家数据稀疏性而面临小样本推断不稳定问题。在构建过程中,ILO需从各国零散的劳动力调查、行政记录中提取并统一数据,面临原始来源标注不一、年度观测值的缺失及'最佳来源'选择可能引入的样本偏移;此外,数据质量旗标(如‘不可靠’状态)的存在要求使用者对异常值进行上下文解读,增加了模型预处理与鲁棒性检验的复杂性。
常用场景
经典使用场景
在劳动经济学与时间利用研究中,该数据集被广泛用于分析亚洲各国不同性别、职业及企业规模下就业人口的实际周均工时分布。研究者可基于其丰富的分类维度,构建面板数据模型,系统刻画东亚、东南亚、南亚及西亚等区域工时模式的异同,从而揭示经济发展阶段、产业结构与劳动供给行为之间的内在关联。
解决学术问题
该数据集有效解决了跨国工时比较研究中数据碎片化与标准不一致的难题。通过ILO统一的统计准则与分类体系,它为探究性别工时差距、职业内工时分化以及正规与非正规部门劳动特征提供了高质量的结构化数据。这些数据支撑了关于劳动政策效果评估、就业质量测量以及体面劳动指标体系建设等核心学术议题的实证检验,推动了亚洲区域劳动经济学的定量研究进展。
实际应用
在实际应用中,该数据集是国际组织、国家统计部门及智库进行劳动市场监测与政策评估的关键工具。它可用于跟踪亚洲各国向可持续发展目标(SDG)第八项体面工作的进展情况,识别特定人群中“过度劳动”或“低工时就业”的风险。企业人力资源规划与社会保障制度设计也能从中获取基准信息,通过对比同行业工时标准优化用工策略。
数据集最近研究
最新研究方向
在亚洲劳动经济学与时序预测的前沿交叉领域,该数据集聚焦于按性别、职业及企业规模细分的周均实际工作时间,为监测后疫情时代亚洲劳动力市场的结构性变迁提供了关键数据支撑。随着国际劳工组织推动体面劳动议程及各国因地制宜调整劳动政策,研究者正利用此时间序列数据(2000-2025年,覆盖25个亚洲国家)开展多层次分析:一方面,通过性别与职业交叉维度的分解,揭示女性非正规就业与工时异质性的深层关联,呼应全球范围内关于性别薪酬鸿沟与工作质量的热议;另一方面,结合企业规模分类,考察中小企业与大型企业在经济波动中的工时调整弹性,为亚洲供应链韧性与劳动保护阈值设定提供实证依据。该数据的标准化整合与公开可复现特性,显著降低了跨国比较的壁垒,推动了区域劳动力模型的泛化能力提升,并已在ILOSTAT框架下成为评估SDG目标8(体面工作和经济增长)进展的核心量具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务