遇见数据集

electricsheepasia/asia-ilo-how-publ-sex-nb-mean-weekly-hours-actually-worked-per-person-in-th

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲公共部门工作人员平均每周实际工作小时数的统计信息,数据来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集覆盖30个亚洲国家,时间跨度为1997年至2025年,共包含744个观测值。核心指标为平均每周实际工作小时数(HOW_PUBL_SEX_NB),数据按性别(总计、男性、女性)进行细分。数据集以表格形式呈现,包括国家代码、国家名称、数据来源、指标代码、性别分类、年份、观测值等字段,适用于表格分类、表格回归和时间序列预测等机器学习任务。数据由Electric Sheep Asia重新打包,以方便在HuggingFace平台上使用。

This dataset contains statistical information on the mean weekly hours actually worked per person in the public sector across Asia, sourced from the International Labour Organizations (ILO) ILOSTAT database. It covers 30 Asian countries from 1997 to 2025, with 744 observations. The core indicator is Mean weekly hours actually worked per person in the public sector (HOW_PUBL_SEX_NB), disaggregated by sex (total, male, female). The data is presented in tabular format with fields such as country code, country name, data source, indicator code, sex classification, year, observed value, etc., suitable for machine learning tasks like tabular classification, tabular regression, and time-series forecasting. The dataset is repackaged by Electric Sheep Asia for ease of use on the HuggingFace platform.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-publ-sex-nb-mean-weekly-hours-actually-worked-per-person-in-th 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于亚洲30个国家的公共部门劳动者每周实际工作小时数。构建过程中,数据通过ILOSTAT REST API直接拉取,并依据ISO3国家代码筛选出亚洲区域。ILO采用国际劳动统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,确保数据在跨国比较中的一致性。最终数据集包含744条观测记录,时间跨度从1997年至2025年,覆盖一个核心指标。
特点
数据集的核心特点在于其精细的维度划分与高质量的数据标注。除核心观测值外,还提供性别细分(总、男、女)以及来源标注、观测状态标识和注释信息,便于研究者追溯数据源头与质量。数据集的年度频率为时序分析提供了坚实基础,且仅收录ILO选定的‘最佳来源’数据,避免了多源冲突。其覆盖的30个亚洲国家在观测数量上呈现明显差异,例如菲律宾和伊朗的样本量远超其他国家,反映出数据获取的异质性。
使用方法
数据集以HuggingFace Datasets库封装,支持直接通过load_dataset函数加载至Python环境。使用者可轻松转换为Pandas DataFrame进行探索性分析,例如按国家代码过滤(如df[df['ref_area']=='IDN'])以聚焦特定区域。对于时间序列分析,可对指标列排序后绘制obs_value随时间变化的曲线。此外,通过pivot_table可将数据重塑为国家×年份的矩阵格式,便于进行跨国的面板数据分析。数据集遵循CC-BY-4.0许可协议,使用时需同时引用ILO原始数据及Electric Sheep Asia的再封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)下属统计部门ILOSTAT创建,经Electric Sheep Asia于2026年重新打包并发布在HuggingFace平台,旨在系统性地呈现亚洲地区公共部门劳动者平均每周实际工作小时数的时序数据。数据集覆盖30个亚洲国家,时间跨度从1997年至2025年,共包含744条观测。其核心研究问题聚焦于量化亚洲公共部门的劳动投入特征,为劳动经济学、比较社会政策及可持续发展目标(SDG)中的体面劳动指标提供可操作的数据基础。作为ILOSTAT这一全球权威劳动统计数据库的子集,该数据集凭借ILO对200多个经济体调查数据的统一标准化处理,显著提升了亚洲区域劳动数据的可比性与研究价值,对跨国劳动市场分析、政策评估及机器学习驱动的时序预测任务具有重要支撑作用。
当前挑战
该数据集的核心挑战在于应对亚洲各国劳动统计体系的异质性。首先,各国数据来源差异显著,包括劳动力调查、行政记录及家庭收支调查等,不同来源的采样方法、定义口径(如ICLS标准本土化程度)可能导致同一指标的可比性偏差;数据集虽标记了最佳来源与断点说明,但跨年度的定义变更与调查中断仍给时序分析带来结构突变风险。其次,构建过程中面临性别维度与国别覆盖的不均衡——30个亚洲国家中,马尔代夫等小岛屿国家数据稀疏,且性别细分(SEX_T、SEX_M、SEX_F)在部分年份存在缺失,限制了基于性别的劳动参与深度分析。此外,数据年度频率较高而季后高频数据未纳入,对于建模公共部门用工波动与宏观经济周期的即时关联提出了补充需求。
常用场景
经典使用场景
该数据集记录了1997年至2025年间亚洲30个经济体公共部门从业人员平均每周实际工作小时数,共计744条观测值,数据来源于国际劳工组织(ILO)的ILOSTAT权威数据库。其经典用途在于支持跨国比较研究,通过标准化指标揭示不同亚洲国家公共部门劳动时间的演变趋势与区域差异。研究者可利用该数据集进行面板数据分析,结合性别维度(男性、女性及总计)的分解,探究工作时间分布的结构性特征。此外,该时间序列数据为预测模型提供了坚实基础,可用于构建自回归或机器学习模型,以推断未来亚洲公共部门劳动市场的时间分配模式。
衍生相关工作
基于该数据集,衍生出一系列重要的学术与实践工作。在计量方法方面,研究者开发了针对不平衡面板数据的填补技术以处理缺失年份,并构建了融合性别与时间变化的混合效应模型。在政策研究领域,该数据被用于评估国际劳工组织工时倡导的实效性,衍生出关于亚洲各国公共部门工作时间变迁的案例研究。此外,该数据集推动了跨数据集整合工作,例如将其与GDP、城市化率等宏观经济指标联立,构建了评价亚洲劳动市场健康度的综合指标体系,这些工作进一步拓展了ILOSTAT数据在可持续发展目标(SDGs)监测中的应用边界。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲公共部门雇员每周实际平均工作时间的时序观测,为劳动经济学与公共政策研究提供了跨30国、近三十年的结构化面板数据。在亚洲劳动力市场弹性化与公共部门效率优化成为区域焦点的背景下,该数据可服务于比较制度分析、生产率核算及性别差异研究,尤其支撑基于机器学习的工时预测与异常检测模型构建。其与ILOSTAT官方数据源的紧密对接,确保了跨国可比性与统计规范性,助力学者与政策制定者追踪后疫情时代公共部门工时演变趋势及就业质量评估,为可持续发展目标(SDG 8.5)中体面工作的量化监测提供了关键实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务