遇见数据集

electricsheepasia/asia-ilo-how-2emp-sex-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲49个国家从2005年至2027年的3,354个观测值,核心指标为按性别划分的就业人员平均每周实际工作时间——国际劳工组织模型估计值(指标代码:HOW_2EMP_SEX_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取并过滤至亚洲国家。数据集提供了按性别(总计、男性、女性)细分的年度统计数据,涵盖国家代码、国家名称、数据来源、观测年份、观测值及状态等字段。数据经过国际劳工组织基于国际劳工统计学家会议(ICLS)定义进行标准化处理,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 3,354 observations across 49 Asia countries from 2005 to 2027, focusing on the indicator Mean weekly hours actually worked per employed person by sex -- ILO modelled estimates (code: HOW_2EMP_SEX_NB). Sourced from the International Labour Organizations (ILO) ILOSTAT database via its REST API and filtered to Asian countries, it provides annual statistics disaggregated by sex (total, male, female). The dataset includes fields such as country codes, country names, data sources, observation years, observed values, and status flags. Data is harmonized by the ILO based on International Conference of Labour Statisticians (ICLS) definitions and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-2emp-sex-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集基于国际劳工组织(ILO)的ILOSTAT数据库构建,通过REST API接口直接提取指标“HOW_2EMP_SEX_NB”的原始数据,并依据亚洲国家ISO3代码进行地理范围过滤。ILO依据国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行统一协调处理,数据来源在“source.label”列中予以标注以保障可追溯性。数据集由Electric Sheep Asia团队重新封装,以Parquet格式发布至HuggingFace平台,旨在为研究人员提供开箱即用的机器学习就绪数据层。
特点
本数据集收录了2005年至2027年间亚洲49个国家的3,354条观测值,涵盖周平均实际工作时长这一核心劳动指标。数据按性别维度进行细粒度分解,包含总计、男性和女性三个类别,便于开展性别差异分析。每条记录均标注了观测状态标志,如实数值、临时值或不可靠值,有助于用户进行数据质量甄别。数据频率为年度,覆盖时间跨度长达23年,为长期劳动市场趋势研究提供了连续且一致的时间序列基础。
使用方法
用户可通过HuggingFace的`datasets`库直接加载该数据集,使用`load_dataset("electricsheepasia/asia-ilo-how-2emp-sex-nb-mean-weekly-hours-actually-worked-per-employed-per")`命令即可获取训练集并转换为Pandas DataFrame。针对特定国家的分析,可利用`ref_area`列进行过滤,如筛选印度尼西亚的数据。对于时间序列分析,可依`indicator`和`time`列排序后直接绘图。此外,支持跨国家、跨年份的透视表操作,便于构建国家×年份的观测值矩阵,适用于面板数据分析和回归建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,经Electric Sheep Asia团队重新整理后于2026年5月上线。数据集聚焦亚洲49个国家在2005至2027年间按性别分列的就业者周均实际工时,涵盖3,354条观测值,数据源自ILOSTAT数据库。ILOSTAT作为全球劳动统计的核心平台,整合了各国劳动力调查、家庭收入调查及行政记录等多元来源,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集旨在揭示亚洲劳动力市场的工时分布特征,为跨国比较、性别差异分析及劳动政策评估提供了关键数据支撑,对劳动经济学、可持续发展目标(SDG)监测及区域劳动力研究具有重要参考价值。
当前挑战
数据集面临的核心挑战在于跨时间与跨国家的数据可比性:不同国家因统计调查体系差异,工时数据在收集方法、定义口径及质量上存在显著异质性,ILO虽通过模型估计进行标准化,但模型本身可能引入系统偏差。其次,亚洲地区非正规就业比例较高,传统调查难以全面覆盖灵活用工、自雇及家务劳动等群体,导致工时数据可能低估实际劳动投入。此外,数据集仅提供年度观测值,无法捕捉短期波动与季节性效应,且部分国家存在数据缺失或仅基于模拟推算,削弱了时间序列分析的精度。在构建过程中,数据整合需处理多来源冲突标注,并确保49国的地理编码与性别分类一致,对清洗与验证流程提出了较高要求。
常用场景
经典使用场景
该数据集是国际劳工组织(ILO)通过ILOSTAT平台发布的亚洲地区就业者平均每周实际工作时间的权威统计资料,涵盖2005年至2027年间49个亚洲国家的数据。在劳动经济学与公共政策研究领域,该数据集最经典的用途在于进行跨国别、长时序的劳动工时比较分析。研究人员可利用其按性别划分的观测值,系统考察亚洲各国劳动力市场的工作强度变迁趋势,揭示经济发展阶段、产业结构转型与劳动时间之间的内在关联。此外,数据集的时序特性使其成为构建面板数据模型的理想素材,为检验劳动供给理论中的收入-闲暇替代效应提供经验支撑。该数据集还支持研究者识别亚洲区域内部工时模式的异质性,从而深化对全球化背景下亚洲劳动制度多样性的理解。
衍生相关工作
该数据集催生了多条富有成效的研究路径。其一,构建亚洲劳动工时预测模型,学者基于2005-2027年的历史观测值,应用Prophet、Gradient Boosting等机器学习算法对2028年及以后的工时趋势进行外推,为前瞻性政策制定提供参考。其二,将工时数据与其他ILO指标(如失业率、非正规就业比例、劳动生产率)进行多变量联立分析,揭示亚洲劳动力市场供求关系的深层互动机制。其三,数据集的跨国面板结构驱动了因果推断研究的繁荣,研究者运用双重差分法或工具变量法识别最低工资制度、劳动时间上限等政策干预的实际效果。其四,不少工作将工时数据与联合国人类发展指数、世界银行治理指标相耦合,探讨劳动条件与更广泛社会福祉之间的复杂关联,形成了跨学科融合的研究范式。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲49国2005至2027年按性别划分的就业者平均实际周工时,其前沿研究正与全球劳动力市场韧性、性别平等及后疫情时代工作模式变迁紧密交织。在国际劳工组织(ILO)的标准化模型估算支持下,研究者得以利用此时序数据剖析亚洲经济体——从中国、印度到中东新兴市场——在产业结构转型、自动化渗透及非正规就业扩张中的工时分化规律。热点方面,该数据直接服务于SDG 8体面工作与经济增长目标的量化追踪,尤其在评估女性劳动参与障碍与工时薪酬不对等问题上具有关键证据价值;而时间跨度延伸至2027年的预测值,则为政策模拟与超长期劳动供给弹性建模提供了罕见基线。其作为HuggingFace上首个亚细亚劳工统计规整化数据集,实质填补了该区域跨国可比微观数据在机器学习可复现性上的空白,推动了以数据驱动方式诠释亚洲劳动伦理演变的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务