遇见数据集

electricsheepasia/asia-ilo-emp-5emp-sex-oc2-nb-employment-by-sex-and-occupation-isco-level-2-19th

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含10,229个观察值,覆盖20个亚洲国家,时间跨度为2014年至2025年,涉及1个指标:按性别和职业(国际标准职业分类第2级,基于第19届国际劳工统计学家会议标准,单位为千)统计的就业数据。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过标准化处理,适用于表格分类、表格回归和时间序列预测等任务。

This dataset contains 10,229 observations of employment data across 20 Asia countries, spanning 2014–2025, covering 1 distinct indicator: Employment by sex and occupation - ISCO level 2 based on the 19th International Conference of Labour Statisticians (ICLS) standard, in thousands. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), harmonized for machine learning readiness, and suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-5emp-sex-oc2-nb-employment-by-sex-and-occupation-isco-level-2-19th 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API直接获取原始指标数据,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行统一协调,确保跨国可比性。数据经Electric Sheep Asia重新封装,以Parquet格式标准化存储于HuggingFace平台,用户可通过`load_dataset()`函数直接调用,极大简化了数据获取流程。
特点
数据集蕴含10,229条观测记录,覆盖2014年至2025年间20个亚洲国家的就业数据,核心指标为按性别和职业(ISCO二级分类)统计的就业人数(单位:千)。数据以年频记录,支持按性别(总计、男性、女性、其他)进行维度拆分,并包含数据来源标识与观测状态标记(如临时、不可靠),便于用户评估数据质量。其结构化模式囊括国家代码、指标标签、分类变量及注释信息,为跨国时间序列分析提供了坚实基础。
使用方法
用户可通过HuggingFace的`datasets`库加载数据集,并转为Pandas DataFrame进行灵活操作。典型应用场景包括:筛选特定国家的就业数据以分析其劳动力市场趋势;按时间排序观测值构建单指标时间序列并进行可视化;以及利用透视表功能将数据重塑为国家×年份矩阵,便于开展面板数据分析或计量建模。数据集兼容分类与回归任务,亦适用于时间序列预测,为劳动经济学研究提供了便捷工具。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年构建并发布,经由Electric Sheep Asia整理封装至HuggingFace平台,旨在提供亚洲地区按性别和职业分类的就业数据。数据集涵盖2014至2025年间20个亚洲国家的10,229条观测记录,核心指标为基于第19届国际劳工统计学家会议(ICLS)定义的ISCO二级职业分类就业人数(单位:千人)。作为ILOSTAT数据库的子集,该数据整合了各国劳动力调查、家庭收入调查及行政记录等多源信息,填补了亚洲区域精细化就业统计的空白,为研究劳动力市场结构变迁、性别就业差异及国际劳动力分工提供了高颗粒度的纵向时序数据,有力推动了发展经济学与劳动经济学领域的实证研究。
当前挑战
该领域面临的核心挑战在于跨国产出数据的高度异质性与可比性问题。各国在职业分类标准执行、调查方法选择及统计时间窗口上存在差异,尽管ILO通过ICLS定义进行协调,但数据来源字段中标注的‘方法论修订’与‘系列中断’仍揭示了历史序列间断的固有难题。构建过程中,跨源数据融合需处理多国多时点指标同义异值的情况,且ILO仅选用‘最佳来源’处理国家年份重叠记录,潜在地舍弃了部分有效观测。此外,非标准化职业分类注释(如涵盖助理人员)削弱了ISCO二级分类的精确度,而数据仅提供年度频次,未能涵盖月度或季度高频波动,限制了短期就业动态的捕捉能力。
常用场景
经典使用场景
在劳动经济学与区域发展研究中,该数据集作为亚洲地区跨年度、跨性别的职业就业结构标准数据源,被广泛用于构建多维度面板回归模型,分析不同性别在ISCO二级职业分类中的就业分布演变趋势。研究者常借助该数据集探索经济发展阶段、产业结构转型与就业性别隔离之间的关联机制,通过时间序列分析捕捉2014至2025年间亚洲20国就业格局的变迁轨迹。其细粒度分类体系支持从宏观区域比较到微观职业类别的层层递进分析,成为阐释亚洲劳动力市场动态特征的经典实证素材。
衍生相关工作
该数据集催生了一系列深化劳动统计分析的方法论与工具创新。基于其标准化的数据格式,研究者开发了专门用于ILOSTAT数据的自动化清洗与整合流水线,实现了多源劳动统计数据的无缝对接。在预测建模领域,衍生工作包括构建面向亚洲国家就业结构的时序预测模型,融合宏观经济变量与人口特征提升预测精度。同时,该数据集推动了交互式可视化分析平台的发展,使得非专业用户也能通过仪表盘动态探索性别与职业交叉维度的就业变迁。值得注意的是,Electric Sheep Asia还围绕该数据集建立了统一的区域数据层,为后续在亚洲范围内开展跨国家、跨学科的劳动力研究提供了可复用的基础设施范本。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别和职业划分的就业结构分析,依托ILOSTAT权威来源,覆盖2014至2025年间20个亚洲国家的就业数据。当前前沿研究主要围绕后疫情时代亚洲劳动力市场的性别差异化复苏、非正规就业与职业隔离的动态演变,以及数字化转型对传统职业分类体系的冲击。结合ILO近期推动的第19届国际劳动统计学家会议(ICLS)标准更新,该数据集为评估体面劳动目标的区域进展、比较各国就业政策效果,以及构建跨国产能协作模型提供了高粒度时间序列基础。其引入的ISCO-08二级职业分类与性别交叉变量,更成为研究人工智能替代效应、零工经济扩张等热点议题中劳动力结构变迁的关键数据支撑,对推动亚洲包容性增长与可持续发展议程具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务