遇见数据集

electricsheepasia/asia-ilo-emp-xflb-sex-ocu-nb-inflow-of-employed-foreign-born-population-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲9个国家(包括菲律宾、印度尼西亚、泰国、科威特、柬埔寨、亚美尼亚、阿曼、黎巴嫩和阿联酋)从1997年至2024年的287个观测值,涉及按性别和职业划分的就业外国出生人口流入(千)这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API获取并过滤为亚洲国家。数据集涵盖了就业外国出生人口的流入情况,按性别(总计、男性、女性)和职业分类进行细分,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并包含数据质量说明,如使用ILO选择的最佳来源。数据集由Electric Sheep Asia重新打包,以Parquet格式提供,便于机器学习使用,并遵循CC-BY-4.0许可。

This dataset includes 287 observations across 9 Asian countries (the Philippines, Indonesia, Thailand, Kuwait, Cambodia, Armenia, Oman, Lebanon, and the United Arab Emirates) covering the period from 1997 to 2024, centered on the indicator of inflows of foreign-born employed populations measured in thousands, disaggregated by gender and occupation. The data is sourced from the ILOSTAT statistical database of the International Labour Organization (ILO), acquired via REST API and filtered to only include Asian nations. This dataset provides coverage of inflows of foreign-born employed populations, with breakdowns by gender (total, male, female) and occupation, and is applicable to tasks such as tabular classification, regression, and time series forecasting. The data is released at an annual frequency, and includes data quality notes such as the use of best-in-class sources selected by the ILO. This dataset was repackaged by Electric Sheep Asia, made available in Parquet format for machine learning applications, and is distributed under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-xflb-sex-ocu-nb-inflow-of-employed-foreign-born-population-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接提取指标代码为EMP_XFLB_SEX_OCU_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义的标准化框架,对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一整合,确保数据在跨国家、跨时段的可比性。数据集涵盖1997年至2024年间9个亚洲国家的287条观测记录,经Electric Sheep Asia重新打包为Parquet格式,便于机器学习领域的直接调用。
特点
数据集以年度频率记录按性别和职业分类的就业型外国出生人口流入量(单位:千人次),提供ISO 3166-1 alpha-3国家代码、数据来源标签、观测值及状态标记等17个标准字段。其独特之处在于包含性别维度(总/男/女)及职业技能层级分类(如OCU_SKILL_TOTAL),并附有ILO选定的最佳来源标识及系列中断等注释信息,为研究者提供详尽的元数据溯源能力。数据涵盖菲律宾、印度尼西亚、泰国等国,时间跨度与观测密度因国家而异,整体呈现亚洲地区国际移民劳动力流动的时空异质性。
使用方法
通过HuggingFace Datasets库的load_dataset函数即可一键加载,返回的DataFrame可直接用于Python分析环境。用户可依据ref_area字段筛选特定国家(如印尼IDN)的子集,或按indicator列过滤单一指标进行时间序列可视化。针对面板数据分析需求,可利用pivot_table将数据重塑为国家×年份矩阵,便于开展跨国比较或计量模型构建。数据集采用cc-by-4.0许可协议,使用时需同时引用ILO原始数据源及Electric Sheep Asia的重新打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2024年创建,经Electric Sheep Asia重新整理并发布于HuggingFace平台,聚焦亚洲9个国家1997至2024年间按性别与职业分类的受雇外国出生人口流入量(单位:千)。数据集旨在为区域劳动力迁移研究提供标准化、可复用的时间序列数据,涵盖菲律宾、印度尼西亚、泰国等典型目的地国,填补了亚洲跨国劳动力流动微观数据整合的空白。其核心研究问题在于揭示亚洲内部移民就业结构与性别、职业维度的动态关联,为劳动经济学、人口地理学及国际发展政策评估提供实证基础。凭借ILOSTAT的权威统计框架与统一分类标准,该数据集已成为分析亚洲国际移民就业趋势的关键资源,对理解全球南方劳动力市场的空间重构具有范式意义。
当前挑战
该数据集的核心挑战在于解决亚洲国际劳动力流动领域中长期存在的统计碎片化与可比性不足问题。一方面,亚洲各国移民统计口径差异显著(如调查年份、定义标准与数据来源各异),导致跨国家、跨时间的动态建模易受结构性偏差干扰;另一方面,数据仅覆盖9国且时间跨度不均(如阿曼仅含2021年数据),限制了因果推断与面板分析的稳健性。构建过程中,需从ILOSTAT异构API中清洗、对齐并统一编码非标准化的源标签与分类变量(如职业技能等级、性别拆分),同时处理因方法变更(如序列中断)引发的数据一致性问题,这对自动化的数据管道和人工校验提出了双重精度要求。
常用场景
经典使用场景
亚洲地区作为全球劳动力流动最为活跃的区域之一,其国际移民的就业结构长期受到劳动经济学与发展研究领域的密切关注。该数据集汇集了来自ILOSTAT权威数据库、覆盖9个亚洲国家1997至2024年间约287条观测记录,核心指标为按性别和职业划分的就业型外国出生人口流入量。研究人员可借助此数据进行面板数据分析,探索亚洲各国移民劳动力市场吸纳能力的动态演变;亦可结合性别维度展开细分研究,揭示不同职业层级中跨境就业模式的性别差异与结构性特征。
解决学术问题
在学术层面,该数据集有效弥补了亚洲地区高分辨率国际移民就业流数据的稀缺短板,为劳动经济学中关于移民劳动力市场融合、职业分层及性别不平等议题提供了量化证据。它使研究者能够系统考察经济全球化背景下亚洲国家间劳动力再配置的规模与趋势,进而检验推拉理论、人力资本流动模型以及双重劳动力市场假说等经典理论在区域语境中的适用性。其时间跨度的延展性也为纵向比较与因果推断提供了扎实的数据基础。
衍生相关工作
作为ILOSTAT体系在区域层面的精心重组,该数据集直接衍生了多项关于亚洲跨境劳动力流动的计量经济学研究。基于这些数据,研究者已构建了移民就业流入的预测模型,并利用时间序列分析方法揭示了经济周期、政策变革与移民规模之间的动态关联。此外,将性别与职业交叉分类的维度应用于劳动力市场性别隔离指数测算,成为评估亚洲国家移民就业机会平等程度的重要工具。该数据集也常作为基准,与ILOSTAT全球版本或其他区域子集联合使用,开展跨洲际比较分析。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务