遇见数据集

electricsheepasia/asia-ilo-emp-temp-sex-ind-cbr-nb-employment-by-ilo-sector-and-sex-and-place-of-birt

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含按国际劳工组织部门、性别和出生地划分的就业数据(以千计),覆盖亚洲16个国家,时间跨度为2000年至2024年,提供17,313个观测值。数据来源于国际劳工组织的ILOSTAT数据库,通过API获取并经过亚洲国家筛选,涵盖单一指标EMP_TEMP_SEX_IND_CBR_NB,用于分析就业趋势和模式。数据集包括国家代码、来源、性别分类、观测年份和数值等字段,适用于表格分类、回归和时间序列预测等任务。

This dataset contains employment data by ILO sector, sex, and place of birth (in thousands) across 16 Asian countries, spanning from 2000 to 2024, with 17,313 observations. It is sourced from the ILOSTAT database of the International Labour Organization, retrieved via API and filtered for Asian countries, focusing on the indicator EMP_TEMP_SEX_IND_CBR_NB. The dataset includes fields such as country codes, sources, sex disaggregation, observation years, and values, and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-temp-sex-ind-cbr-nb-employment-by-ilo-sector-and-sex-and-place-of-birt 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接提取指标编码为EMP_TEMP_SEX_IND_CBR_NB的就业数据,并依据亚洲地区的ISO3国家代码进行地理过滤。ILOSTAT采用国际劳动统计学家会议(ICLS)定义对原始调查微观数据进行统一规范化处理,数据来源在source.label列中予以标注以确保可追溯性。数据集最终由Electric Sheep Asia进行重新打包,形成可直接用于机器学习的表格格式。
特点
该数据集包含自2000年至2024年间覆盖16个亚洲国家的17,313条观测记录,涵盖单一核心指标即按ILO部门、性别及出生地划分的就业人数(千计)。数据结构丰富,提供国别、性别、行业分类及出生地等多维交叉分类维度,并包含数据来源、观测状态及方法注释等元信息列,便于用户深入理解数据质量与历史变更。数据频率为年度,且针对同一国家年份的多个来源采用ILO选定的“最佳来源”,确保了数据的一致性和可靠性。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,使用load_dataset函数即可将数据转换为Pandas DataFrame进行后续分析。典型应用包括按国家代码过滤获取特定国家子集、对单一指标进行时间序列可视化、以及通过透视表构建国家×年份的矩阵以进行跨国的比较分析。数据集适用于表格分类、回归及时间序列预测等多种任务场景,为亚洲劳动力市场的经济研究提供了标准化的数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年整理,经Electric Sheep Asia重新包装后发布于HuggingFace平台,聚焦亚洲16个国家2000至2024年间按ILO产业部门、性别及出生地划分的就业数据,总计17,313条观测记录。ILOSTAT作为全球劳动力统计的核心数据库,基于各国劳动力调查、住户收入调查及行政记录等多元来源,通过ILO统计部门统一协调,为就业、失业、工资等关键指标提供标准化数据。该数据集的核心研究问题在于揭示亚洲地区就业结构的时空演变规律,尤其关注产业部门分布、性别差异及人口迁移(出生地)对就业形态的影响,为区域经济比较、可持续发展目标(SDG)监测及劳动政策制定提供坚实的数据基础。其发布填补了亚洲区域精细化就业面板数据的空白,推动了跨国产学研领域对劳动力市场动态的量化分析。
当前挑战
该数据集所面临的挑战主要体现在三个层面。其一,领域问题的复杂性:就业数据受经济周期、政策调整及突发事件(如疫情)影响而呈现非线性波动,需结合多维分类变量(性别、产业、出生地)建立稳健的预测模型,但现有统计方法难以充分捕捉跨层次交互效应。其二,数据整合困难:原始数据来自16国不同调查体系,虽经ILO统一协调,但仍存在方法论修订(如‘break in series’标注)、来源标志变更及观测状态不确定性(如‘unreliable’标记)等问题,导致时间序列存在断点与噪声,需谨慎处理数据间断与可比性。其三,构建过程中的技术挑战:不同国家数据频率(年度为主)不一致、子指标(如月度或季度序列)缺失,以及针对同一国家年份的多源冲突需依赖ILO‘最佳来源’选择策略,可能引入主观偏向,影响后续分析的可复现性。
常用场景
经典使用场景
在亚太地区劳动经济学与可持续发展目标(SDGs)的研究中,该数据集的核心价值在于提供横跨16个亚洲国家、长达25年(2000—2024)的就业时间序列观测。其典型使用场景包括构建面板数据模型以分析亚洲各国在不同ILO经济部门的就业结构变迁,或是利用性别与出生地等维度进行交叉比较。研究人员常将其与ILOSTAT其他指标(如失业率、工资水平)联合使用,以揭示亚洲劳动力市场的动态演化规律。
衍生相关工作
基于该数据集的经典衍生工作主要体现在三个方向:一是构建亚洲就业的预测性模型,例如结合各国人口普查数据预测未来十年的行业劳动力配置;二是开发跨数据库的整合分析平台,将ILOSTAT数据与世界银行的教育或健康指标进行融合建模;三是催生了针对东南亚或中亚次区域的专题研究报告,这类工作往往依托本数据集的高时间分辨率特性,揭示特定地缘冲击(如疫情、供应链重构)对不同性别、出生地就业群体的差异化冲击路径。
数据集最近研究
最新研究方向
该数据集为亚洲劳动力市场研究提供了结构化、可复现的微观数据基础,当前前沿方向聚焦于三大维度:其一,利用时间序列分析与面板数据模型,探究后疫情时代亚洲各国就业结构的动态变化与性别差异,尤其关注建筑、服务与制造业的劳动力再分配;其二,结合移民身份与出生地分类,剖析跨境劳动力流动对本土就业市场的冲击与融合机制,回应区域经济一体化与地缘政治变迁下的劳动力迁移热点;其三,通过机器学习方法(如梯度提升与长期短期记忆网络)构建非正规就业预警系统,支持国际劳工组织(ILO)的体面劳动监测与可持续发展目标(SDG 8)进展评估,为政策制定者提供跨国比较的实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务