遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-est-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)的ILOSTAT数据库的统计数据,主题为工作时间。具体而言,它提供了亚洲24个国家从2000年至2025年期间,按性别和机构规模划分的员工实际平均每周工作时间指标(指标代码:HOW_XEES_SEX_EST_NB)。数据集包含3,591个观察值,覆盖1个独立指标。数据通过ILOSTAT REST API获取,并过滤为亚洲国家代码,经过ILO使用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据列包括国家代码、国家名称、数据来源、指标代码、性别分类、机构规模分类、观察年份、观察值、观察状态和相关注释等,支持表格分类、回归和时间序列预测等任务。

This dataset contains statistics from the ILOSTAT database of the International Labour Organization (ILO), focusing on Hours of work. Specifically, it provides the indicator Mean weekly hours actually worked per employee by sex and establishment size (indicator code: HOW_XEES_SEX_EST_NB) for 24 Asia countries spanning from 2000 to 2025. The dataset includes 3,591 observations covering 1 distinct indicator. Data is pulled directly from the ILOSTAT REST API and filtered to Asia ISO3 country codes, harmonized by the ILO using International Conference of Labour Statisticians (ICLS) definitions. Columns include country code, country name, data source, indicator code, sex disaggregation, establishment size classification, observation year, observed value, observation status, and related notes, supporting tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-est-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,经由Electric Sheep Asia团队从REST API接口直接采集并重新封装。原始数据遵循国际劳工统计学家会议(ICLS)定义,通过ILO对各国劳动力调查、家庭收支调查及行政记录等微观数据进行统一协调与标准化处理。数据过滤聚焦于24个亚洲国家的ISO3代码,形成了涵盖2000至2025年间3,591条观测记录的时序数据集,并以Parquet格式发布,便于机器学习直接加载。
特点
数据集围绕单一核心指标——按性别和企业规模划分的雇员每周实际工作平均小时数——展开,提供了细致的分类维度,包括性别(总、男、女)和机构规模。其独特之处在于不仅包含观测值,还附有来源标签、观测状态标记以及数据断点或方法修订等说明性注释,为数据质量评估提供了透明度。覆盖24个亚洲国家的时间序列长度不一,从十余年到二十余年不等,反映了各国统计能力的差异。
使用方法
用户可通过HuggingFace的`datasets`库一键加载数据,使用`load_dataset()`函数即可获取训练集并转化为Pandas DataFrame方便后续分析。基于清晰的列结构,研究者能够轻松按国家代码进行过滤以聚焦特定区域,或针对单一指标按时间排序进行时序可视化。此外,借助`pivot_table`函数可快速将数据重塑为国家×年份的矩阵形式,便于进行跨国的比较分析与面板数据建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Asia平台重新封装,聚焦于亚洲地区雇员按性别与单位规模划分的周平均实际工时统计。数据集涵盖24个亚洲国家,时间跨度从2000年至2025年,包含3591条观测记录,核心指标来源于ILOSTAT数据库——全球劳动统计领域的权威来源,基于国家劳动力调查、家庭收入调查及行政记录等多元数据。其核心研究问题在于揭示亚洲劳动力市场中工时模式的性别差异与单位规模异质性,为劳动经济学、区域发展研究及国际比较提供精细化的分层数据支撑,尤其有助于弥合发展中国家工时统计的碎片化缺口。该数据集作为ILO可持续发展目标体面工作指标的重要补充,在学术与政策研究中具有广泛的应用潜力。
当前挑战
该数据集所解决的领域问题在于应对亚洲劳动统计中多维分层数据的系统性缺失:传统工时数据往往仅提供汇总均值,难以刻画性别与单位规模交叉影响下的工时分布差异,而该数据集通过细分性别与机构规模,为精准识别劳动力市场不平等提供了基础。构建过程中面临的核心挑战包括:多国数据源的异质性——各国家庭调查与机构调查的定义、抽样框架及质量控制标准迥异,需通过ILO的ICLS定义统一调和;时间序列的断裂问题——部分国家因方法论修订或调查轮替导致数据不连续,如数据集中明确标注的'Break in series: Methodology revised';以及稀疏采样难题——如柬埔寨仅有66条观测、东帝汶覆盖2001至2013年,高维缺失值增加了跨时空分析的复杂度。
常用场景
经典使用场景
在劳动经济学与统计学的交叉领域中,该数据集为分析亚洲地区雇员每周实际工作时间的性别差异与企业规模效应提供了高颗粒度的观测基础。其经典用途在于构建多元回归模型或面板数据模型,以探究性别(男/女/总计)与企业规模(分类变量)如何协同影响工作时长,进而揭示劳动力市场中潜在的性别不平等现象及企业异质性特征。研究者可借此检验女性是否系统性面临更短的周工时,以及该模式是否随企业规模扩大而减弱或增强。
衍生相关工作
该数据集已然催生一系列衍生性探索,其中最突出的方向是将ILO标准化工时数据与宏观经济指标(如GDP增长率、女性劳动参与率)或制度变量(如产假天数、最低工资水平)进行融合,形成多源面板以分析福利制度对工时性别差距的调节机制。部分工作进一步引入机器学习方法,利用时间序列预测模型(如Prophet、LSTM)对亚洲各国周工时进行短期外推,并与ILO官方预测相互校验。此外,也有学者以此数据训练跨国家分类模型,尝试仅凭工时分布特征推断国家的发展阶段或劳动政策类型,拓展了劳动统计在比较政治经济学中的应用边界。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区劳动者每周实际工作时长的多维度跨时研究,涵盖性别与机构规模的分层信息,为劳动经济学与区域发展研究提供了珍贵的时间序列数据。在当前全球热议的‘缩短工时’与‘灵活就业’浪潮中,这一数据集不仅支持学者追踪亚洲各国从2000年至2025年间的工作时长演变规律,还能深入剖析大型企业与小型机构在工时安排上的结构性差异,以及男女性别在劳动参与强度上的分化路径。其与ILOSTAT的对接确保了数据采集与统计口径的国际可比性,尤其契合联合国可持续发展目标中体面工作的议题,对于评估后疫情时代亚洲劳动力市场的恢复韧性与社会政策调整具有重要实证意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务