遇见数据集

electricsheepasia/asia-ilo-emp-xfrb-sex-cbr-nb-employed-foreign-born-population-by-sex-and-countr

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于按性别和出生国划分的就业外国出生人口(千人)的统计信息,专门针对亚洲地区。数据集由国际劳工组织(ILO)的ILOSTAT数据库提供,并通过Electric Sheep Asia重新打包。它涵盖了14个亚洲国家(如黎巴嫩、以色列、印度尼西亚、泰国、约旦、阿曼、文莱、塞浦路斯、蒙古、亚美尼亚、格鲁吉亚、柬埔寨、韩国和土耳其),时间跨度为1992年至2024年,总共包含1,385个观测值。数据集聚焦于一个独特指标:EMP_XFRB_SEX_CBR_NB,该指标衡量就业外国出生人口的数量(以千人为单位),并按性别和出生国进行细分。数据以表格形式呈现,包括国家代码、国家名称、数据来源、指标代码、性别分类、观测年份、观测值等列,并提供了数据质量说明,如年度频率、最佳来源选择以及细分列的非空条件。数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为研究人员和开发者提供机器学习就绪的亚洲劳动力统计数据。

This dataset contains statistical information on employed foreign-born population (in thousands) disaggregated by gender and country of birth, specifically focusing on the Asian region. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), and repackaged by Electric Sheep Asia. The dataset covers 14 Asian countries including Lebanon, Israel, Indonesia, Thailand, Jordan, Oman, Brunei, Cyprus, Mongolia, Armenia, Georgia, Cambodia, the Republic of Korea, and Turkey, spans the period from 1992 to 2024, and contains a total of 1,385 observations. It focuses on a unique indicator: EMP_XFRB_SEX_CBR_NB, which measures the number of employed foreign-born population (in thousands) and is disaggregated by gender and country of birth. The data is presented in tabular format, with columns including country code, country name, data source, indicator code, gender classification, observation year, observed value, etc., and includes data quality notes such as annual frequency, best source selection, and non-null conditions for disaggregated columns. This dataset is applicable for tasks such as tabular classification, tabular regression, and time series forecasting, aiming to provide researchers and developers with machine learning-ready Asian labor force statistics.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-xfrb-sex-cbr-nb-employed-foreign-born-population-by-sex-and-countr 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接提取指标代码为EMP_XFRB_SEX_CBR_NB的原始数据,并依据亚洲ISO3国家代码进行筛选与整合。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家户收入调查及行政记录等微观数据进行统一协调处理,确保了跨国的数据可比性。数据集最终涵盖了14个亚洲国家的1,385条观测记录,时间跨度从1992年至2024年,并以Parquet格式封装,便于机器学习场景下的高效加载与使用。
特点
本数据集聚焦于亚洲地区就业型外国出生人口(单位:千人),按性别和出生国进行精细划分,提供了三个性别维度(总计、男性、女性)的观测值。数据来源标记字段(source.label)保证了每条记录的可追溯性,观测状态标志(obs_status)则提示数据质量(如是否属于非可靠数据)。所有指标均采用ILOSTAT统一编码体系,且包含国家名称、指标标签等元数据列,便于理解与筛选。数据频率为年度,在多个国家具有连续多年的序列,为分析亚洲移民劳动市场的长期趋势与结构性变化提供了坚实的数据基础。
使用方法
用户可通过Hugging Face Datasets库一键加载,只需调用`load_dataset()`函数即可将数据转换为Pandas DataFrame格式,方便进行后续分析。例如,可按`ref_area`列筛选特定国家(如印度尼西亚)的数据;亦可通过`indicator`列过滤出单一指标的时间序列,并使用`matplotlib`进行可视化。对于面板数据分析,可借助`pivot_table`将数据重塑为国家×年份的矩阵形式,以支持跨国的对比研究。该数据集适用于表格分类、回归及时间序列预测等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT数据库编译并经由Electric Sheep Asia于2024年整理发布,聚焦于亚洲14个国家在1992至2024年间按性别和出生国划分的受雇外国出生人口数量(单位:千人)。作为全球劳动统计的核心权威来源,ILOSTAT通过统一整合各国劳动力调查、行政记录等多源数据,为理解亚洲地区跨国劳动力流动格局提供了标准化、可比的时间序列资源。这一数据集填补了区域内移民就业统计的空白,为劳动经济学、人口迁移研究及国际发展政策制定提供了关键支撑,尤其对分析亚洲经济体在全球供应链中对外籍劳动力的依赖程度具有深远意义。
当前挑战
该数据集所应对的核心领域挑战在于亚洲劳动力市场中外国移民就业数据的碎片化与不一致性——各国统计口径、调查频率及定义标准差异悬殊,导致跨国民间比较与趋势建模极为困难。其构建过程中面临多重技术挑战:需从ILOSTAT的REST API中抽取海量原始数据,并仅筛选亚洲国家的ISO3代码;需处理多来源(如劳动力调查、行政记录)数据在时间跨度上的不连续性及标注不一致;还需解决性别与出生国等细粒度分类变量存在的缺失值问题,同时确保每年的“最佳来源”选择逻辑透明可追溯,从而维持数据集在时间序列分析中的完整性与可靠性。
常用场景
经典使用场景
该数据集涵盖1992年至2024年间14个亚洲国家的13.85万条观测记录,核心指标为按性别和出生国划分的就业型外国出生人口数量。经典使用场景包括跨国劳动力迁移模式分析、时间序列下的性别差异对比,以及亚洲各国外来就业人口规模的横向比较。研究者可借助该数据集构建面板数据模型,探究经济周期、政策变化与移民就业动态之间的关联,也可用于训练时序预测模型,模拟未来数年亚洲区域移民劳动力供给的演变趋势。
解决学术问题
该数据集解决了亚洲区域国际移民劳动力统计中数据分散、口径不一的核心难题。长期以来,学术研究受限于各国调查体系的差异,难以获得可比性的跨国就业移民数据。该数据集基于ILOSTAT统一标准,严格遵循国际劳工统计学家会议定义,提供了性别与出生国双重维度的精细化分解,为研究外来劳动力对东道国就业市场的影响、移民性别平等议题,以及劳动力流动与经济发展的交互作用提供了可靠的数据支撑,推动了亚洲移民经济学与劳动经济学的实证研究进展。
衍生相关工作
该数据集衍生了一系列重要的学术研究工作,包括对亚洲各国就业移民流动性的非线性建模、基于贝叶斯结构时间序列的外籍劳动力预测研究,以及融合社会经济协变量(如GDP、教育水平)的因果推断分析。经典工作如利用该数据构建固定效应模型量化移民劳动力对本国产出弹性的影响,或采用动态面板广义矩估计方法探讨移民性别分工的演化路径。数据集的跨国面板特性还催生了基于时空图网络的迁移流预测模型,进一步拓展了劳动经济学与计算社会科学的交叉研究疆域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务