遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-est-mts-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含26,836个观测值,涉及工作时长数据,覆盖24个亚洲国家,时间跨度为2000年至2025年,包含1个独特指标。具体指标为按性别、机构规模和婚姻状况划分的就业人员平均每周实际工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并过滤为亚洲国家代码。数据集包括国家代码、国家名称、来源代码、指标代码、性别分类、机构规模分类、婚姻状况分类、观测年份、观测值、观测状态等列,用于表格分类、回归和时间序列预测任务。数据以年度频率发布,经过ILO标准化处理,并包含数据质量说明,如使用最佳来源和分类列的非空条件。

This dataset contains 26,836 observations of Hours of work data across 24 Asia countries, spanning 2000–2025, covering 1 distinct indicator. The indicator is Mean weekly hours actually worked per employed person by sex, establishment size and marital status. Data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled via REST API and filtered to Asia ISO3 country codes. It includes columns such as country code, country name, source code, indicator code, sex classification, establishment size classification, marital status classification, observation year, observed value, and observation status, suitable for tabular classification, regression, and time-series forecasting tasks. The data is annual frequency, harmonized by ILO, and includes caveats like use of best source and non-null conditions for disaggregation columns.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-est-mts-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT统计数据库提供,经Electric Sheep Asia重新打包整理。数据直接通过ILOSTAT REST API(接口地址为https://rplumber.ilo.org/data/indicator?id=HOW_TEMP_SEX_EST_MTS_NB)获取,并依据亚洲ISO 3166-1 alpha-3国家代码进行筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义的标准,对来自各国劳动力调查、住户收入调查、企业调查及行政记录的微观数据进行统一协调与清洗,在数据集中以source.label字段标注原始数据来源,确保每条观测值的可追溯性。最终形成涵盖24个亚洲国家、26,836条观测的年度面板数据。
特点
该数据集聚焦于亚洲地区按性别、企业规模和婚姻状况分组的受雇人员每周实际工作平均小时数,时间跨度覆盖2000年至2025年。其核心优势在于多维度的精细分解:sex字段提供总、男、女三种性别分类;classif1和classif2字段分别表征企业规模与婚姻状况的分组标签。数据质量经过ILO官方把关,当同一国家年份存在多个数据源时,自动选用ILO认定的“最佳来源”。此外,obs_status字段标记了观测值的可靠性状态(如不稳定的“U”标识),便于用户评估数据可信度。整体以Parquet格式存储,经归一化处理后便于机器读取与时空分析。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,仅需一行代码即可将数据转化为Pandas DataFrame格式,便于后续分析。典型应用包括:使用ref_area字段过滤特定国家(如印度尼西亚)的数据,以进行国别研究;按indicator字段筛选指标后,利用time和obs_value列构建单一指标的时间序列并可视化其演变趋势;还可通过pivot_table操作将数据重塑为国家×年份的矩阵,支持跨国的横向比较与面板计量建模。数据集以cc-by-4.0许可协议发布,使用时需同时引用ILO原始数据与Electric Sheep Asia的封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年通过其核心数据库ILOSTAT整理发布,并由Electric Sheep Asia团队重新打包并托管至HuggingFace平台,聚焦于亚洲地区就业人口的周均实际工时统计。数据集涵盖了2000年至2025年间24个亚洲国家的26,836条观测记录,核心研究问题在于通过性别、企业规模及婚姻状况等多维细分维度,系统刻画亚洲劳动力市场中工时分布的异质性特征。作为全球劳动统计领域权威数据源ILOSTAT的区域性子集,该数据集为劳动经济学、发展经济学及可持续发展目标(SDGs)中的体面工作指标研究提供了标准化、机器可读的高质量面板数据,对促进亚洲区域间跨国比较分析与劳动政策评估具有重要支撑作用。
当前挑战
该数据集所解决的领域挑战主要在于亚洲劳动力市场工时统计的高度碎片化与跨国可比性缺失。由于各国采用不同的调查方法(如劳动力调查、企业调查与行政记录),原始数据在定义、频率与分类标准上存在显著差异,ILOSTAT虽通过国际劳动统计学家会议(ICLS)定义进行了标准化,但数据质量仍受来源国调查方案差异影响,观测值中标记为'不可靠'的记录即体现了这一根本性矛盾。在构建过程中,Electric Sheep Asia团队面临跨越24个国家、涵盖2000年至2025年时间跨度的多源数据整合挑战,需从ILOSTAT REST API中筛选并过滤亚洲国家ISO3代码,同时处理缺失的分类维度(如特定国家部分年份仅有总数而无性别或婚姻状况细分),以及处理时间序列中的频次不匹配(仅保留年度频率,排除月度与季度数据)等典型数据清洗难题。
常用场景
经典使用场景
该数据集收录了国际劳工组织ILOSTAT数据库中关于亚洲24个国家2000至2025年间每周实际工作时间的官方统计信息,涵盖性别、企业规模与婚姻状况等多维度细分指标。研究者常将其用于构建面板数据模型,分析亚洲地区劳动力市场的时空演变规律。通过纵向追踪各国不同群体的工时变化,经典研究场景聚焦于揭示经济发展阶段与工时之间的动态关联,以及性别差异在工时分布中的显隐特征。该数据集为量化劳动经济学中的结构性议题,如非正规就业形态对工时的影响,提供了坚实的数据基础。
实际应用
该数据集的实用价值体现在政策制定与国际基准评估之中。国际组织与各国劳工部门可借助其发布的工时统计,动态监控本国劳动市场的健康状况,评估劳动法规的执行效果,并依据国际标准判别是否存在过劳或就业不足现象。企业在进行区域投资决策时,也可通过分析目标国家不同行业与规模的工时特征,评估劳动力成本与生产效率。此外,非政府组织能够利用该数据集识别弱势群体(如已婚女性或小型企业雇员)面临的劳动权益风险,进而倡导更具包容性的劳动保护政策。
衍生相关工作
基于该数据集衍生了多项具有影响力的研究工作。学者们构建了亚洲工时预测模型,结合宏观经济变量如GDP增长率与产业结构,预判未来劳动力供给格局。另有研究将其与教育水平、职业类别等其他ILOSTAT指标关联,开发出综合性劳动力市场指数,用于评估各国体面劳动进展。还有工作聚焦于性别工时的收敛性检验,通过时间序列协整分析,论证了经济发展与性别平等之间的非线性关系。这些衍生研究不仅深化了劳动经济学理论,也为循证决策提供了方法论创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务