遇见数据集

electricsheepeurope/europe-ilo-eip-dwap-sex-edu-geo-rt-inactivity-rate-by-sex-education-and-rural-urban-a

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家从1987年至2025年的“其他劳动力利用不足指标”数据,具体指标为“按性别、教育程度和城乡划分的非活动率(%)”。数据集共有91,920个观测值,涵盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并经过欧洲国家筛选,使用国际劳工统计学家会议定义进行标准化。数据集为表格格式,包含国家代码、指标代码、性别分类、教育程度分类、城乡分类、年份、观测值等列,适用于表格分类、回归和时间序列预测任务。数据为年度频率,并包含数据质量注释,如观测状态标志。

--- license: CC BY 4.0 language: - en task_categories: - 表格分类 - 表格回归 - 时间序列预测 multilinguality: 单语言 size_categories: - 10K<n<100K tags: - 表格数据 - 欧洲 - ILOSTAT(国际劳工组织统计数据库) - 劳动力未充分利用其他衡量指标 - 国际劳工组织(International Labour Organization,ILO) - 劳动力 - 就业 pretty_name: "按性别、教育程度及城乡地区划分的非活动率(%)| 欧洲(ILOSTAT)" --- # 按性别、教育程度及城乡地区划分的非活动率(%)| 欧洲(ILOSTAT) 🇪🇺 **91920条观测数据** · **39个欧洲国家** · **1987–2025年** · *由[Electric Sheep Europe](https://huggingface.co/electricsheepeurope)重新封装发布* ![数据行数](https://img.shields.io/badge/rows-91,920-blue) ![覆盖国家数](https://img.shields.io/badge/countries-39-green) ![时间跨度](https://img.shields.io/badge/years-1987–2025-orange) ![指标数量](https://img.shields.io/badge/indicators-1-purple) ![许可证](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 核心摘要 本数据集包含**91920条观测数据**,涵盖39个欧洲国家1987至2025年的`劳动力未充分利用其他衡量指标`相关数据,仅包含1个专属指标。 ## 数据源说明 **ILOSTAT(国际劳工组织统计数据库)**是国际劳工组织(International Labour Organization,ILO)的核心统计数据库,为全球领先的劳动力统计权威来源。该库收录覆盖就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害及可持续发展目标(SDGs)体面工作目标等领域的指标,数据来源包括全国劳动力调查、家庭收入调查、机构调查及行政记录。其覆盖全球200余个经济体,数据标准化工作由国际劳工组织统计部门负责完成。 - **数据来源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EIP_DWAP_SEX_EDU_GEO_RT) - **发布方**:国际劳工组织(International Labour Organization,ILO) - **许可证**:[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) - **研究主题**:劳动力未充分利用其他衡量指标 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EIP_DWAP_SEX_EDU_GEO_RT`拉取原始数据,并筛选出欧洲地区的ISO 3166-1 alpha-3国家编码对应的样本。ILOSTAT采用国际劳工统计学家会议(International Conference of Labour Statisticians, ICLS)制定的定义对原始调查微观数据进行标准化处理;数据来源信息将在`source.label`字段中标记,以保证可追溯性。 ## 地理覆盖范围 本数据集覆盖39个欧洲国家,以下按数据行数降序展示部分国家的统计详情: | 国家代码 | 数据行数 | 起始年份 | 终止年份 | |---------|-----:|-----------:|----------:| | `GRC` | 5,047 | 1987 | 2025 | | `FRA` | 3,357 | 1993 | 2024 | | `ITA` | 3,299 | 1992 | 2024 | | `PRT` | 3,233 | 1992 | 2024 | | `BEL` | 3,233 | 1992 | 2024 | | `IRL` | 3,225 | 1993 | 2024 | | `ESP` | 3,175 | 1992 | 2024 | | `NLD` | 3,018 | 1996 | 2024 | | `SWE` | 2,958 | 1995 | 2024 | | `LUX` | 2,947 | 1997 | 2024 | | `DEU` | 2,934 | 1992 | 2024 | | `LTU` | 2,923 | 1998 | 2024 | | `DNK` | 2,923 | 1992 | 2024 | | `EST` | 2,911 | 1997 | 2024 | | `AUT` | 2,770 | 1995 | 2025 | | ... | _24个其他国家_ | | | ## 指标(示例) - `EIP_DWAP_SEX_EDU_GEO_RT` — 按性别、教育程度及城乡地区划分的非活动率(%) ## 数据字段结构 | 字段名 | 数据类型 | 字段说明 | 示例值 | |--------|------|-------------|---------| | `ref_area` | 字符串 | ISO 3166-1 alpha-3国家代码 | `ALB` | | `ref_area.label` | 字符串 | 国家英文名称 | `Albania` | | `source` | 字符串 | ILOSTAT来源代码(如劳动力调查) | `BB:7401` | | `source.label` | 字符串 | 数据来源英文名称 | `HIES - 生活水平调查` | | `indicator` | 字符串 | ILOSTAT指标代码 | `EIP_DWAP_SEX_EDU_GEO_RT` | | `indicator.label` | 字符串 | 指标英文名称 | `Inactivity rate by sex, education and…` | | `sex` | 字符串 | 性别细分维度(SEX_T=总计,SEX_M=男性,SEX_F=女性) | `SEX_T` | | `sex.label` | 字符串 | — | `总计` | | `classif1` | 字符串 | 第一分类变量(年龄、教育程度、身份等) | `EDU_AGGREGATE_TOTAL` | | `classif1.label` | 字符串 | — | `教育程度(汇总层级):总计` | | `classif2` | 字符串 | 可选第二分类变量 | `GEO_COV_NAT` | | `classif2.label` | 字符串 | — | `区域类型:全国范围` | | `time` | 64位整数 | 观测年份 | `2012` | | `obs_value` | 64位浮点数 | 观测指标值(单位随指标变化,请参考指标定义) | `59.202` | | `obs_status` | 字符串 | 观测状态标记(如暂定、不可靠) | `U` | | `obs_status.label` | 字符串 | — | `不可靠` | | `note_classif` | 字符串 | — | `C3:5578` | | `note_classif.label` | 字符串 | — | `非标准教育程度:包含…` | | `note_indicator` | 字符串 | — | `I11:264` | | `note_indicator.label` | 字符串 | — | `序列中断:方法学已修订` | | `note_source` | 字符串 | — | `R1:3513` | | `note_source.label` | 字符串 | — | `存储库:ILO统计数据库 - 微观数据…` | ## 细分维度 以下字段提供数据细分维度: - **`sex`**(共3个唯一取值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 本数据集采用年度频率数据。部分指标同时提供月度或季度序列数据,但本数据集未包含此类内容。 - 当同一国家×年份的同一指标存在多个数据来源时,将采用国际劳工组织选定的“最优来源”数据。 - 细分字段(`sex`、`classif1`、`classif2`)仅在指标支持对应细分维度时才会有非空值。 ## 使用示例 python from datasets import load_dataset ds = load_dataset("electricsheepeurope/europe-ilo-eip-dwap-sex-edu-geo-rt-inactivity-rate-by-sex-education-and-rural-urban-a") df = ds["train"].to_pandas() print(df.head()) ### 单国家数据筛选 python germany = df[df["ref_area"] == "DEU"] ### 单指标时间序列可视化 python sample = (df[df["indicator"] == "EIP_DWAP_SEX_EDU_GEO_RT"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EIP_DWAP_SEX_EDU_GEO_RT") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EIP_DWAP_SEX_EDU_GEO_RT"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{europe_ilo_eip_dwap_sex_edu_geo_rt_inactivity_rate_by_sex_education_and_rural_urban_a_2025, title = {Inactivity rate by sex, education and rural / urban areas (%) | Europe (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EIP_DWAP_SEX_EDU_GEO_RT}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Europe}, howpublished = {url{https://huggingface.co/datasets/electricsheepeurope/europe-ilo-eip-dwap-sex-edu-geo-rt-inactivity-rate-by-sex-education-and-rural-urban-a}} } ## 许可证 本数据集采用[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)许可协议发布。原始数据版权归国际劳工组织(International Labour Organization,ILO)所有。使用本数据集时,请同时引用上述原始数据源及Electric Sheep Europe的重新封装版本。 ## 关于Electric Sheep Electric Sheep Europe是Electric Sheep项目的组成部分:该项目旨在HuggingFace平台上构建一套统一的、适配机器学习的欧洲地区数据层。我们从权威开源数据源拉取数据,对数据schema进行标准化处理,封装为Parquet格式,并发布格式统一的数据集卡片,使研究人员与开发者可通过`load_dataset()`函数在数秒内启动数据分析工作。 浏览完整数据集集合:[huggingface.co/electricsheepeurope](https://huggingface.co/electricsheepeurope) --- _数据溯源:2026年5月27日通过Electric Sheep数据流水线获取。原始数据源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EIP_DWAP_SEX_EDU_GEO_RT_

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-dwap-sex-edu-geo-rt-inactivity-rate-by-sex-education-and-rural-urban-a 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,专注于欧洲地区因性别、教育程度及城乡差异导致的劳动闲置率指标。构建过程中,数据通过ILOSTAT的REST API直接获取,并依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行标准化处理。随后,数据集被精心筛选至涵盖39个欧洲国家的ISO3代码范围,最终汇集了91,920条观测记录,时间跨度从1987年至2025年,确保了数据的区域聚焦性与时间纵深感。
特点
该数据集的核心特点在于其精细的多维拆解能力,提供了按性别(男、女、总计)、教育水平及城乡地域交叉分类的非经济活动率观测值。每条记录均包含源数据标注,确保了信息的可追溯性与透明度。数据集统一为年频数据,并优先采用ILO选定的“最佳来源”以保障数据质量,同时辅以观测状态标记,如实反映数据的初步性或不可靠性,为研究人员提供了严谨的数据质量提示。
使用方法
数据集可通过HuggingFace的`datasets`库便捷加载,使用`load_dataset()`函数即可将数据转化为Pandas DataFrame进行深度分析。用户能够轻松按国家代码筛选特定国家的子集,或对单一指标按时间排序进行时间序列分析与可视化。此外,数据集支持通过数据透视表操作,灵活构建以年份为行、国家为列的矩阵视图,便于进行跨国比较与趋势研究,极大提升了劳动经济学分析的可操作性与效率。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门基于ILOSTAT数据库创建,由Electric Sheep Europe于2025年前后重新打包并发布至HuggingFace平台。数据涵盖1987年至2025年间39个欧洲国家的91,920条观测记录,聚焦于按性别、教育程度及城乡地域划分的经济不活跃率(Inactivity rate)。作为全球劳动统计的权威来源,ILOSTAT通过整合国家劳动力调查、家庭收入调查及行政记录等多元数据,为研究劳动力市场结构性特征提供了关键支撑。该数据集中,经济不活跃率作为衡量劳动力未充分利用的重要指标,能够揭示不同社会群体在劳动参与中的差异性表现,对于政策制定者分析就业障碍、评估教育投资回报以及优化区域发展策略具有深远意义。其精细化的多维分类维度(性别、教育层次、城乡地域)使得研究者能够深入剖析劳动力市场的动态演变,从而为欧洲乃至全球的劳动经济学研究提供了宝贵的数据基础。
当前挑战
该数据集所解决的领域核心挑战在于,传统劳动力统计常以宏观失业率作为主要指标,却未能充分反映那些因教育水平低下或地域隔离而退出劳动市场的群体状况,经济不活跃率恰恰填补了这一分析空白。然而,构建过程中面临多重技术挑战:首先,数据源涉及39个国家不同时期的调查体系,各机构对教育层次、城乡定义的统计口径存在差异,ILOSTAT虽通过ICLS标准进行统一化处理,但非标准教育分类(如note_classif字段所示)仍可能引入测量误差。其次,时间序列数据中存在方法论修订、调查间断(如note_indicator字段记录的序列断裂),导致跨年度可比性受损。此外,部分观测值标记为不可靠(obs_status字段标记为“U”),需要在建模时审慎处理。最后,数据虽为年度频率,但未包含部分国家发布的月度或季度细分数据,限制了高频动态分析的能力,而多源数据的最优来源选择机制也可能引入选择偏差,影响估计的一致性。
常用场景
经典使用场景
在欧洲劳动力市场的宏观研究框架下,该数据集聚焦于按性别、教育程度及城乡地域划分的劳动参与人口闲置率,为剖析劳动力资源错配与结构性失业提供了精细化的量化窗口。其最经典的使用场景在于构建多维度面板回归模型与时间序列预测,用以揭示不同社会群体在经济周期波动中退出劳动力市场的差异化行为模式,尤其擅长捕捉教育水平与城乡二元结构对劳动参与决策的交互效应。
实际应用
在实际政策制定层面,该数据集直接服务于欧盟及各成员国劳动与社会事务部的精准施策,例如通过追踪城乡间女性与低技能人群的闲置率演变,辅助设计差异化的职业培训补贴与农村就业振兴计划。跨国可比性使其成为国际组织监测‘体面劳动’可持续发展目标进展的核心数据源,尤其适用于开发动态预警系统以识别区域性劳动力市场脆弱性。
衍生相关工作
该数据集衍生出的经典工作包括基于多任务学习框架的劳动力闲置率联合预测模型,以及融合空间计量方法的欧洲劳动力市场溢出效应研究。一批前沿工作利用其细粒度分组特征构建了社会分层与劳动退出的因果图模型,此外,以该数据为基准的跨性别与教育群体的聚类分析为统计学习中的不均衡采样技术提供了标准化测试床,推动了公平性算法在劳动经济领域的应用落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务