遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-age-cbr-nb-persons-outside-the-labour-force-by-sex-age-and-pl

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲36个国家从1987年到2025年的76,859个观测值,主要指标为按性别、年龄和出生地划分的劳动力市场外人口(以千计)(国际移民存量数据)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Europe重新打包,用于表格分类、回归和时间序列预测等任务。数据集涵盖详细的人口统计维度,包括性别、年龄和出生地分类,并提供数据来源、观测状态和质量注释。

--- license: cc-by-4.0 language: - en task_categories: - 表格分类(tabular-classification) - 表格回归(tabular-regression) - 时间序列预测(time-series-forecasting) multilinguality: 单语(monolingual) size_categories: - 10K<n<100K tags: - 表格数据 - 欧洲 - ILOSTAT - 国际移民存量(international-migrant-stock) - ILO - 劳工 - 就业 pretty_name: "按性别、年龄和出生地划分的非劳动力人口(千人)| 欧洲(ILOSTAT)" --- # 按性别、年龄和出生地划分的非劳动力人口(千人)| 欧洲(ILOSTAT) 🇪🇺 **76,859条观测数据** · **36个欧洲国家** · **1987–2025年** · *由[Electric Sheep Europe](https://huggingface.co/electricsheepeurope)重新整理发布* ![数据行数](https://img.shields.io/badge/rows-76,859-blue) ![国家数量](https://img.shields.io/badge/countries-36-green) ![涵盖年份](https://img.shields.io/badge/years-1987–2025-orange) ![指标数量](https://img.shields.io/badge/indicators-1-purple) ![许可协议](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 核心摘要(TL;DR) 本数据集包含覆盖36个欧洲国家的`国际移民存量(international migrant stock)`相关观测数据共76,859条,时间跨度为1987年至2025年,仅包含1项明确指标。 ## 关于数据源 **ILOSTAT(国际劳工组织统计数据库)**是国际劳工组织(International Labour Organization, ILO)的核心统计数据库,也是全球领先的劳工统计数据源。其收录的指标涵盖就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(SDGs)体面工作相关目标,数据来源包括全国劳动力调查、家庭收入调查、机构调查及行政记录。该数据库覆盖200余个经济体,数据的标准化工作由国际劳工组织统计部门负责。 - **数据来源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EIP_TEIP_SEX_AGE_CBR_NB) - **发布方**:国际劳工组织(International Labour Organization, ILO) - **许可协议**:[cc-by-4.0](https://creativecommons.org/licenses/by/4.0/) - **研究主题**:国际移民存量 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EIP_TEIP_SEX_AGE_CBR_NB`获取数据,并筛选出使用ISO 3166-1 alpha-3标准的欧洲国家代码的数据。ILOSTAT采用国际劳工统计学家会议(International Conference of Labour Statisticians, ICLS)的定义对原始调查微观数据进行标准化处理;数据来源会在`source.label`字段中标记,以确保可追溯性。 ## 地理覆盖范围 覆盖36个欧洲国家,以下为按数据行数排序的前10个国家: | 国家(ISO3代码) | 数据行数 | 起始年份 | 结束年份 | |---------|-----:|-----------:|----------:| | `SWE` | 3,176 | 1995 | 2025 | | `GRC` | 3,135 | 1987 | 2025 | | `NOR` | 3,125 | 1995 | 2025 | | `NLD` | 3,093 | 1995 | 2025 | | `GBR` | 2,939 | 1995 | 2025 | | `DNK` | 2,935 | 1995 | 2025 | | `FRA` | 2,918 | 1995 | 2025 | | `PRT` | 2,736 | 1995 | 2025 | | `BEL` | 2,734 | 1995 | 2025 | | `IRL` | 2,706 | 1998 | 2025 | | `FIN` | 2,622 | 1995 | 2025 | | `LUX` | 2,589 | 1995 | 2025 | | `AUT` | 2,588 | 1995 | 2025 | | `ESP` | 2,588 | 1995 | 2025 | | `ISL` | 2,435 | 1995 | 2024 | | ... | _其余21个国家_ | | | ## 指标示例 - `EIP_TEIP_SEX_AGE_CBR_NB` — 按性别、年龄和出生地划分的非劳动力人口(千人) ## 数据结构(Schema) | 字段名 | 数据类型 | 字段说明 | 示例 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3 国家代码 | `ALB` | | `ref_area.label` | `string` | 英文国家名称 | `Albania`(阿尔巴尼亚) | | `source` | `string` | ILOSTAT 来源代码(如劳动力调查) | `BA:480` | | `source.label` | `string` | 英文来源名称 | `LFS - Labour Force Survey`(劳动力调查) | | `indicator` | `string` | ILOSTAT 指标代码 | `EIP_TEIP_SEX_AGE_CBR_NB` | | `indicator.label` | `string` | 英文指标名称 | `Persons outside the labour force by s…`(按性别、年龄和出生地划分的非劳动力人口,缩略) | | `sex` | `string` | 性别细分字段(`SEX_T`=总计,`SEX_M`=男性,`SEX_F`=女性) | `SEX_T` | | `sex.label` | `string` | 对应标签 | `Total`(总计) | | `classif1` | `string` | 第一分类变量(年龄、教育程度、身份等) | `AGE_YTHADULT_YGE15` | | `classif1.label` | `string` | 分类变量英文标签 | `Age (Youth, adults): 15+`(年龄(青年、成人):15岁及以上) | | `classif2` | `string` | 可选第二分类变量 | `CBR_BIR_TOTAL` | | `classif2.label` | `string` | 分类变量英文标签 | `Place of birth: Total`(出生地:总计) | | `time` | `int64` | 观测年份 | `2024` | | `obs_value` | `float64` | 观测指标值(单位详见指标定义) | `738.429` | | `obs_status` | `string` | 观测状态标记(如临时、不可靠) | `U` | | `obs_status.label` | `string` | 对应标签 | `Unreliable`(不可靠) | | `note_classif` | `string` | — | `—` | | `note_classif.label` | `string` | — | `—` | | `note_indicator` | `string` | — | `I11:264` | | `note_indicator.label` | `string` | — | `Break in series: Methodology revised`(序列中断:方法已修订) | | `note_source` | `string` | — | `R1:3513` | | `note_source.label` | `string` | — | `Repository: ILO-STATISTICS - Micro da…`(存储库:ILO统计数据库-微观数据,缩略) | ## 数据细分维度 以下字段提供数据细分维度: - **`sex`**(共3种唯一取值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时发布月度或季度序列,但本数据集未收录此类数据。 - 当同一国家×年份的同一指标存在多个数据源时,将采用国际劳工组织选定的“最优数据源”。 - 仅当指标支持对应细分维度时,细分字段(`sex`、`classif1`、`classif2`)才不会为空值。 ## 使用示例 python from datasets import load_dataset ds = load_dataset("electricsheepeurope/europe-ilo-eip-teip-sex-age-cbr-nb-persons-outside-the-labour-force-by-sex-age-and-pl") df = ds["train"].to_pandas() print(df.head()) ### 按单一国家筛选 python germany = df[df["ref_area"] == "DEU"] ### 单一指标的时间序列可视化 python sample = (df[df["indicator"] == "EIP_TEIP_SEX_AGE_CBR_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EIP_TEIP_SEX_AGE_CBR_NB") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EIP_TEIP_SEX_AGE_CBR_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{europe_ilo_eip_teip_sex_age_cbr_nb_persons_outside_the_labour_force_by_sex_age_and_pl_2025, title = {Persons outside the labour force by sex, age and place of birth (thousands) | Europe (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EIP_TEIP_SEX_AGE_CBR_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Europe}, howpublished = {url{https://huggingface.co/datasets/electricsheepeurope/europe-ilo-eip-teip-sex-age-cbr-nb-persons-outside-the-labour-force-by-sex-age-and-pl}} } ## 许可协议 本数据集采用[cc-by-4.0](https://creativecommons.org/licenses/by/4.0/)许可协议发布。原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源及Electric Sheep Europe的重新整理版本。 ## 关于 Electric Sheep Electric Sheep Europe是Electric Sheep项目的组成部分:该项目旨在在HuggingFace平台上构建一套统一的、可供机器学习直接使用的欧洲数据层。我们从权威开源数据源获取数据,对数据Schema进行标准化处理,封装为Parquet格式,并发布格式统一的数据集卡片,使研究人员与开发者可通过`load_dataset()`函数在数秒内启动数据分析工作。 浏览完整数据集集合:[huggingface.co/electricsheepeurope](https://huggingface.co/electricsheepeurope) --- _数据溯源:2026年5月27日通过Electric Sheep数据管道摄入。源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EIP_TEIP_SEX_AGE_CBR_NB_

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-age-cbr-nb-persons-outside-the-labour-force-by-sex-age-and-pl 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API从指定指标代码端点直接抽取原始数据,并依据国际劳工统计学家会议(ICLS)定义进行规范化处理。数据筛选范围限定于欧洲36个国家的ISO3国家代码,覆盖1987至2025年间的时间跨度,共计76,859条观测记录。每一观测值均附有来源标签,确保数据可追溯性与可靠性。最终由Electric Sheep Europe团队完成重打包,以Parquet格式呈现,便于机器学习直接加载。
特点
数据集聚焦于‘按性别、年龄和出生地划分的劳动力人口外人数’这一核心指标,提供细颗粒度的性别(男、女、总计)及年龄分层。数据结构包含丰富的分类维度,如劳动力来源类型和出生地划分,并通过列字段如`obs_status`标记数据质量和可靠性(如临时性或不可靠性)。数据以年度频率组织,针对同一国家与年份的多源数据仅采用ILO选定的‘最佳来源’,保证了统计一致性。三个分类列仅在相应指标提供细分时才填充,维护了数据的简洁性。
使用方法
数据集可通过Hugging Face的`datasets`库轻松加载,调用`load_dataset`即可将数据转换为Pandas DataFrame进行深入分析。研究人员可按国家代码(如`ref_area == 'DEU'`)快速筛选单一国家的时间序列,或按指标编码对整个序列进行可视化。支持通过pivot_table操作将数据重塑为国家×年份的矩阵格式,便于面板数据分析或时间序列建模。对于需要周期性或跨地域对比的劳动经济学研究,该数据集提供了即用的、标准化的数据入口。
背景与挑战
背景概述
在全球劳动力市场研究中,劳动力市场外人群(即未参与就业或失业统计的个体)的结构与动态是理解社会经济排斥、人口迁移及性别平等议题的关键维度。国际劳工组织(ILO)作为全球劳动统计的权威机构,通过其ILOSTAT数据库系统性地整合了各国劳动力调查数据。在此背景下,由Electric Sheep Europe于2025年基于ILOSTAT数据重新打包发布的“europe-ilo-eip-teip-sex-age-cbr-nb-persons-outside-the-labour-force-by-sex-age-and-pl”数据集应运而生,聚焦欧洲36国、跨越1987至2025年的劳动力市场外人群分布。该数据集以性别、年龄和出生地作为核心分类变量,提供了超过7.6万条观测值,旨在为研究人员提供标准化、可复用的面板数据,以剖析欧洲劳动力市场边缘群体的时空演变规律,对人口经济学、劳动社会学及国际移民研究具有重要的基础数据支撑价值。
当前挑战
该数据集所面临的挑战首先源于其核心研究问题的复杂性:劳动力市场外人群的界定与测量在国际间存在方法论差异,不同国家采用的调查工具与统计标准各异,导致跨国产出数据的可比性受损。ILOSTAT虽通过国际劳动统计学家会议(ICLS)定义进行协调,但数据源标记为“unreliable”或存在序列断裂(如方法论修订)的观测值屡见不鲜,这为时间序列分析与因果推断引入了不确定性。在构建过程中,数据从ILOSTAT的REST API直接抽取,需对欧洲国家ISO代码进行过滤与合并,但由于国家行政区划调整、历史数据缺失及分类维度(如年龄组、出生地定义)的不一致,确保数据一致性成为重大技术挑战。此外,不同调查来源的“最佳来源”选择策略在特定国家—年份组合下可能引入隐藏偏差,进一步增加了数据清洗与整合的难度。
常用场景
经典使用场景
在欧洲劳动力结构与人口迁移的交叉研究领域,该数据集通过提供按性别、年龄和出生地划分的劳动力市场外人群数量(单位:千),成为剖析非经济活动人口构成的核心工具。研究者可借助其涵盖36个欧洲国家、跨度近四十年的年度观测值,运用时间序列分析与面板数据回归,精准刻画不同人口亚群退出劳动力市场的动态演变。该数据与性别、年龄分类维度相结合,使得从代际更替与移民融合角度解析欧洲劳动力供给弹性的研究成为可能。
解决学术问题
该数据集系统性地回应了劳动经济学中长期存在的结构性难题,即如何跨越国别统计口径差异,实现对非经济活动人口的跨国标准化比较。通过依赖ILOSTAT基于国际劳工统计学家定义所进行的统一微数据调和,数据集有效消弭了各国调查方法异质性带来的量化偏差,为探究移民身份与劳动参与率之间的因果关联提供了可靠证据基础。其深远意义在于,使学界能够更严谨地检验福利制度、劳动力市场管制以及人口老龄化如何共同形塑欧洲边缘劳动力群体的规模与特征。
衍生相关工作
围绕该数据集衍生了一系列标志性研究工作,包括利用其时间跨度构建欧洲非经济活动人群的预测模型,以量化移民涌入与劳动市场摩擦的长期效应。部分学者将其与失业率、工资中位数等经济指标关联,开展面板协整分析,揭示劳动力市场外的结构性封锁状态。此外,该数据已融入稳健性检验环节,作为核心变量验证关于移民社会融合对本土劳动参与率的挤出或补充效应的竞争性假说,并启发了许多聚焦性别差异的跨国比较计量研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务