遇见数据集

electricsheepasia/asia-ilo-emp-xflc-sex-eco-nb-inflow-of-employed-foreign-citizens-by-sex-and-eco

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格型数据集,专注于亚洲国家就业外国公民流入的统计。它包含1,164个观测值,覆盖14个亚洲国家(如土耳其、吉尔吉斯斯坦、蒙古等),时间跨度为2001年至2024年。数据集的核心指标是按性别和经济活动划分的就业外国公民流入量(千),用于衡量国际移民流动。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤至亚洲地区,经过标准化处理,包含国家代码、年份、性别分类、经济活动分类、观测值等字段。数据集适用于表格分类、回归或时间序列预测任务,旨在为研究人员和开发者提供机器学习就绪的亚洲劳动力市场数据。

--- 许可证:CC BY 4.0 语言: - 英语 任务类别: - 表格分类 - 表格回归 - 时间序列预测 多语言属性:单语言 样本量范围: - 1000 < 样本量 < 10000 标签: - 表格数据 - 亚洲 - ILOSTAT - 国际移民流动 - 国际劳工组织(ILO) - 劳动力 - 就业 美观名称:"按性别与经济活动划分的就业外籍公民流入量(千人)| 亚洲(ILOSTAT)" --- # 按性别与经济活动划分的就业外籍公民流入量(千人)| 亚洲(ILOSTAT) 🌏 **1164条观测样本** · **14个亚洲国家** · **2001年至2024年** · *由[Electric Sheep Asia](https://huggingface.co/electricsheepasia)重新封装* ![样本行数](https://img.shields.io/badge/样本行数-1,164-blue) ![国家数量](https://img.shields.io/badge/国家数量-14-green) ![时间跨度](https://img.shields.io/badge/时间跨度-2001–2024-orange) ![指标数量](https://img.shields.io/badge/指标数量-1-purple) ![许可证](https://img.shields.io/badge/许可证-cc-by-4.0-lightgrey) ## 核心摘要 本数据集包含覆盖14个亚洲国家的国际移民流动数据,共计1164条观测样本,时间跨度为2001年至2024年,仅包含1项核心指标。 ## 数据源说明 **国际劳工组织统计数据库(ILOSTAT)**是国际劳工组织(ILO)的核心统计数据库,是全球领先的劳动力统计数据来源。该数据库整合了就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(SDG)体面工作目标等领域的指标,数据来源涵盖全国劳动力调查、家庭收入调查、机构调查与行政记录。其覆盖全球200多个经济体,数据的标准化工作由国际劳工组织统计部门负责。 - **数据来源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_XFLC_SEX_ECO_NB) - **发布方**:国际劳工组织(ILO) - **许可证**:[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) - **主题**:国际移民流动 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EMP_XFLC_SEX_ECO_NB`获取原始数据,并筛选出亚洲地区的ISO 3166-1 alpha-3国家代码对应的样本。ILOSTAT采用国际劳工统计学家会议(International Conference of Labour Statisticians, ICLS)的定义对原始调查微观数据进行标准化处理;数据来源的标识信息存储在`source.label`列中,以确保数据可追溯。 ## 地理覆盖范围 本数据集覆盖14个亚洲国家,以下按样本行数排序展示部分国家: | 国家代码 | 样本行数 | 起始年份 | 结束年份 | |---------|---------:|---------:|---------:| | `TUR` | 312 | 2011 | 2024 | | `KGZ` | 200 | 2005 | 2014 | | `MNG` | 162 | 2012 | 2020 | | `MYS` | 162 | 2007 | 2020 | | `IDN` | 62 | 2012 | 2022 | | `PHL` | 51 | 2001 | 2023 | | `THA` | 48 | 2006 | 2024 | | `LAO` | 36 | 2022 | 2024 | | `YEM` | 33 | 2003 | 2013 | | `VNM` | 33 | 2005 | 2015 | | `ARM` | 22 | 2014 | 2021 | | `AZE` | 15 | 2018 | 2018 | | `KHM` | 15 | 2019 | 2019 | | `NPL` | 13 | 2017 | 2017 | ## 指标(示例) - `EMP_XFLC_SEX_ECO_NB` — 按性别与经济活动划分的就业外籍公民流入量(千人) ## 数据结构 | 列名 | 数据类型 | 字段说明 | 示例 | |--------|------|-------------|---------| | `ref_area` | 字符串型 | ISO 3166-1 alpha-3 国家代码 | `ARM` | | `ref_area.label` | 字符串型 | 英文国家名称 | `Armenia` | | `source` | 字符串型 | ILOSTAT 来源代码(如劳动力调查) | `BA:867` | | `source.label` | 字符串型 | 英文来源名称 | `LFS - Household Labour Force Survey` | | `indicator` | 字符串型 | ILOSTAT 指标代码 | `EMP_XFLC_SEX_ECO_NB` | | `indicator.label` | 字符串型 | 英文指标名称 | `Inflow of employed foreign citizens b…` | | `sex` | 字符串型 | 性别细分维度(SEX_T = 总计,SEX_M = 男性,SEX_F = 女性) | `SEX_T` | | `sex.label` | 字符串型 | 维度名称 | `Total` | | `classif1` | 字符串型 | 第一分类变量(年龄、教育程度、就业状态等) | `ECO_SECTOR_TOTAL` | | `classif1.label` | 字符串型 | 分类变量说明 | `Economic activity (Broad sector): Total` | | `time` | int64型 | 观测年份 | `2021` | | `obs_value` | float64型 | 观测指标值(单位详见指标定义) | `2.545` | | `obs_status` | 字符串型 | 观测状态标记(如临时、不可靠) | `—` | | `obs_status.label` | 字符串型 | 状态说明 | `—` | | `note_classif` | 字符串型 | 分类备注 | `C5:2049` | | `note_classif.label` | 字符串型 | 备注说明 | `Nonstandard economic activity: Includ…` | | `note_indicator` | 字符串型 | 指标备注 | `T36:5015` | | `note_indicator.label` | 字符串型 | 备注说明 | `Definition of migrants: Migrants (def…` | | `note_source` | 字符串型 | 来源备注 | `S15:6276_S5:40_S12:6057_T3:104` | | `note_source.label` | 字符串型 | 备注说明 | `Institution producing the data: Natio…` | ## 数据细分维度 以下列提供数据细分维度: - **`sex`**(共3种唯一取值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时发布月度或季度序列,本数据集未包含此类数据。 - 当同一国家×年份的同一指标存在多个数据来源时,将采用国际劳工组织选定的“最优来源”数据。 - 仅当指标支持对应细分维度时,细分列(`sex`、`classif1`、`classif2`)才会有非空值。 ## 使用方法 python from datasets import load_dataset ds = load_dataset("electricsheepasia/asia-ilo-emp-xflc-sex-eco-nb-inflow-of-employed-foreign-citizens-by-sex-and-eco") df = ds["train"].to_pandas() print(df.head()) ### 筛选单个国家 python # 筛选单个国家 indonesia = df[df["ref_area"] == "IDN"] ### 单个指标的时间序列 python # 单个指标的时间序列 sample = (df[df["indicator"] == "EMP_XFLC_SEX_ECO_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EMP_XFLC_SEX_ECO_NB") ### 转换为国家×年份矩阵 python # 转换为国家×年份矩阵 matrix = (df[df["indicator"] == "EMP_XFLC_SEX_ECO_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{asia_ilo_emp_xflc_sex_eco_nb_inflow_of_employed_foreign_citizens_by_sex_and_eco_2024, title = {Inflow of employed foreign citizens by sex and economic activity (thousands) | Asia (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2024}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_XFLC_SEX_ECO_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Asia}, howpublished = {url{https://huggingface.co/datasets/electricsheepasia/asia-ilo-emp-xflc-sex-eco-nb-inflow-of-employed-foreign-citizens-by-sex-and-eco}} } ## 许可证 本数据集采用[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)许可证发布。原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始来源与Electric Sheep Asia的重新封装版本。 ## 关于Electric Sheep Asia Electric Sheep Asia 隶属于Electric Sheep项目:该项目旨在HuggingFace平台上打造统一的、适配机器学习的亚洲地区数据层。我们从权威开放数据源获取数据,对数据schema进行标准化处理,以Parquet格式封装,并发布格式统一的数据集卡片,使研究人员与开发者可通过`load_dataset()`函数在数秒内启动数据分析工作。 浏览完整数据集集合:[huggingface.co/electricsheepasia](https://huggingface.co/electricsheepasia) --- _数据溯源:2026年5月28日通过Electric Sheep流水线获取。原始数据源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_XFLC_SEX_ECO_NB_

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-xflc-sex-eco-nb-inflow-of-employed-foreign-citizens-by-sex-and-eco 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT数据库构建,通过其REST API直接抽取指标编码为EMP_XFLC_SEX_ECO_NB的原始数据,并依据ISO 3166-1 alpha-3标准筛选出覆盖14个亚洲国家的观测记录。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等来源的微观数据进行统一调和,确保跨国可比性。数据采集完成后,由Electric Sheep Asia团队进行重新封装,整理为结构化表格,并在HuggingFace平台上以Parquet格式发布,使得研究者可通过数据加载工具直接调用。
使用方法
使用者可通过HuggingFace的`datasets`库加载该数据集,执行load_dataset()函数即可获取训练集并转换为pandas DataFrame进行后续操作。推荐按`ref_area`列对国家进行筛选以开展国别分析,或依据`indicator`列固定单一指标后按`time`列排序,生成时间序列数据用于绘图或回归建模。亦可利用pivot_table方法,以年份为行、国家代码为列构造透视矩阵,便于进行跨国面板数据分析或作为时间序列预测模型的输入。
背景与挑战
背景概述
在全球劳动力流动日益频繁的背景下,国际劳工组织(ILO)下设的ILOSTAT数据库作为劳动统计领域的权威来源,长期致力于提供跨国、可比的劳动力数据。该数据集由Electric Sheep Asia于2024年重新打包发布,聚焦亚洲14个国家在2001年至2024年间,按性别和经济活动分类的受雇外国公民流入量(单位:千)。数据涵盖1,164条观测记录,核心研究问题在于揭示亚洲区域国际劳动力迁移的结构性特征与动态演变趋势。该数据集的发布为区域劳动经济学、移民政策研究以及跨国劳动力市场建模提供了高颗粒度的基础数据支撑,尤其填补了亚洲发展中国家在官方移民就业统计方面的数据空白,对可持续发展目标(SDG)中体面工作的监测具有重要推动作用。
当前挑战
该数据集所应对的领域挑战主要体现为国际移民就业统计的碎片化与不可比性。不同国家对“移民”定义各异,统计来源(如劳动力调查、行政记录)质量参差不齐,导致跨国比较困难。ILO虽通过ICLS标准进行协调,但数据标注中仍存在“非标准经济活动”和“移民定义差异”等注释,提示用户需谨慎处理分类一致性。构建过程中,数据经ILOSTAT REST API获取后过滤至亚洲区域,面临多源数据整合、缺失值标记及最佳来源选择等技术难题。此外,时间跨度长达24年,部分国家(如阿塞拜疆、柬埔寨)仅有一年数据,导致时序分析面临稀疏性和不连续性挑战,对建模的鲁棒性构成考验。
常用场景
经典使用场景
该数据集的核心应用场景集中于对亚洲地区跨境劳动力流动的定量刻画与时序分析。研究者可据此探究十四个国家在2001至2024年间,受雇外籍公民流入规模随性别与经济活动分类的动态演变规律。通过将观测值按年份与国家维度进行矩阵化重构,便于开展面板数据回归、趋势分解以及季节性调整等经典计量分析。此外,该数据集因其细粒度的性别与产业分类标签,尤为适合用于探讨劳动力市场的性别分化现象,以及不同经济部门对外籍劳动力的吸纳能力,从而为宏观政策模型提供可靠的经验支撑。
解决学术问题
该数据集服务于多项长期悬而未决的学术议题,尤其聚焦于国际移民经济学与劳动经济学交叉领域。它帮助学界突破数据碎片化的瓶颈,系统性地解答了亚洲地区外籍劳动力流入规模如何受到经济发展阶段、产业结构变迁与性别角色演变的影响。通过提供统一来源、标准化定义的多年连续观测数据,研究者得以量化跨国劳动力迁移对本土就业市场的替代与互补效应,检验经典贸易–迁移模型在亚洲语境下的适用性,并评估不同性别劳动力在全球化分工中的结构性差异,深化了对于区域劳动力一体化进程的理论认知。
实际应用
在实际应用层面,该数据集为国际组织、国家劳动部门及研究智库提供了制定与评估移民就业政策的量化工具。例如,各国劳工统计机构可借助该数据监测外籍劳动力流入的产业分布,从而动态调整技能签证配额与行业准入目录。对于跨国企业的人力资源规划而言,通过分析不同经济活动和性别维度下的劳动力供给趋势,可更精准地预判特定区域的招聘成本与人才可得性。同时,非政府组织亦能依据该数据开展针对迁移劳动者权益保护的社会影响评估,推动更公平的劳动保障制度设计。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别与经济活动分列的受雇外籍公民流入量(单位:千人),覆盖2001至2024年间14个国家的1164条观测记录,源自国际劳工组织(ILO)的ILOSTAT数据库。在全球劳动力迁移与区域经济一体化的前沿研究中,此类精细化数据尤为珍贵,正被广泛用于追踪亚洲劳动力市场中外籍劳工的性别分化趋势、行业分布变迁及其与经济增长的耦合关系。结合后疫情时代跨境人员流动复苏、东南亚制造业用工紧缺等热点事件,该数据集为量化分析外来劳动力对本地就业结构的影响、评估性别平等政策成效,以及构建跨国劳工流动的预测模型提供了关键支撑,其开放共享的CC-BY-4.0许可也促进了跨学科研究的可复现性与协作深度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务