遇见数据集

electricsheepeurope/europe-ilo-emp-publ-sex-geo-nb-public-sector-employment-by-sex-and-rural-urban-ar

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含按性别和城乡地区划分的公共部门就业数据(以千计),覆盖10个欧洲国家,时间跨度为1987年至2025年,共有1,656个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家代码。数据集包含一个核心指标EMP_PUBL_SEX_GEO_NB,用于衡量公共部门就业情况,并按性别(总计、男性、女性)和地区类型(如国家层面)进行细分。数据模式包括列如国家代码、国家名称、数据来源、指标代码、性别分类、观测年份、观测值、观测状态和相关注释。数据为年度频率,经过ILO的标准化处理,以确保一致性和可追溯性。数据集适用于表格分类、回归和时间序列预测等任务,旨在为机器学习研究提供欧洲劳动力市场的标准化数据。数据集由Electric Sheep Europe重新打包,以方便在HuggingFace平台上使用。

This dataset contains public sector employment data by sex and rural/urban areas (in thousands), covering 10 European countries from 1987 to 2025, with 1,656 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to European ISO3 country codes. It includes one core indicator EMP_PUBL_SEX_GEO_NB, which measures public sector employment and is disaggregated by sex (total, male, female) and area type (e.g., national level). The schema comprises columns such as country code, country name, data source, indicator code, sex classification, observation year, observed value, observation status, and related notes. The data is annual in frequency and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions for consistency and traceability. This dataset is suitable for tasks like tabular classification, regression, and time-series forecasting, providing a standardized, ML-ready data layer for European labor market research. It has been repackaged by Electric Sheep Europe for ease of use on the HuggingFace platform.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-publ-sex-geo-nb-public-sector-employment-by-sex-and-rural-urban-ar 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,由Electric Sheep Europe团队通过REST API直接从ILOSTAT原始端点拉取数据,并依据欧洲ISO3国家代码进行地理筛选与再封装。ILOSTAT本身整合了来自各国劳动力调查、家庭收入调查、企业调查及行政记录等多源微观数据,并遵循国际劳工统计学家会议(ICLS)定义进行标准化统一。最终构建的数据集包含1,656条观测记录,覆盖10个欧洲国家,时间跨度从1987年至2025年,数据以Parquet格式存储,便于机器学习流水线的直接加载。
特点
该数据集聚焦于公共部门就业的性别与城乡区域划分,以千人为计量单位,提供了唯一指标EMP_PUBL_SEX_GEO_NB的年度观测值。数据涵盖性别维度(总人数、男性、女性)的细粒度分解,并附有详细的源信息标注和观测状态标志,如序列中断等质量提示。由于数据来源于经ILO统一规范的官方统计,具备高度的权威性与可比性。数据集规模适中,包含10个国家在不同年份的观测,时间序列结构清晰,特别适合用于欧洲劳动力市场的纵向比较分析与公共政策评估研究。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数便捷加载该数据集,并将其转换为Pandas DataFrame进行后续分析。典型的使用场景包括按国家筛选特定序列、针对单一指标进行时间序列可视化、以及构建以年份为行、国家为列的透视矩阵。数据集提供了清晰的列名与标签说明,用户可依据ref_area、sex、indicator等字段进行灵活的数据切片与聚合操作。此外,该数据集天然适配表格分类、回归及时间序列预测等机器学习任务,为欧洲公共就业领域的量化研究提供了标准化、易获取的数据基础。
背景与挑战
背景概述
公共部门就业作为衡量政府规模与经济结构的关键指标,长期以来受到劳动经济学与政策研究者的广泛关注。然而,由于各国统计口径差异、数据发布滞后以及性别与城乡维度的缺失,跨国比较研究长期面临数据瓶颈。在此背景下,国际劳工组织(ILO)于2025年通过其核心统计平台ILOSTAT发布了涵盖10个欧洲国家、1987至2025年间共计1656条观测的公共部门就业数据集。该数据集由Electric Sheep Europe进行重新整理与标准化,聚焦于按性别与城乡区域划分的公共部门就业人数(单位:千人次)。其核心研究问题在于揭示欧洲不同国家公共部门就业的性别与地域分布特征,为劳动力市场结构分析、政策评估与可持续发展目标(SDG)监测提供高质量数据基础。作为ILO劳动统计体系的重要组成部分,该数据集已被广泛应用于跨国就业比较、性别平等度量和城镇化进程中公共服务的就业效应研究,显著提升了欧洲劳动统计数据的可获取性与分析深度。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:公共部门就业虽为研究政府规模与就业结构的关键指标,但各国对‘公共部门’的界定及统计口径存在显著差异,且数据常受政策变动、经济周期与行政改革影响,导致时间序列中存在‘序列中断’标记(如methodology revised),给跨时期、跨国比较带来根本性困难。此外,性别与城乡区域的二重维度虽已纳入数据发布,但部分国家细分层级的数据稀疏甚至缺失,例如阿尔巴尼亚仅有2002至2012年共计27条记录,黑山仅含2020年单年9条记录,样本量极不均衡,制约了多变量统计建模的可靠性。在数据构建过程中,主要挑战源于ILOSTAT需整合来自国家劳动力调查、住户生活水平调查、行政记录等多源异构数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化转换,这一过程涉及数据质量标记(如provisional、unreliable、break in series)的判别与传递,需要研究者在使用时谨慎处理观测状态与注释信息,否则易引入系统偏差或错误推断。
常用场景
经典使用场景
该数据集收录了1987至2025年间十个欧洲国家的公共部门就业数据,涵盖性别与城乡地域维度的细致划分,共1656条观测记录。研究者常将其用于面板数据分析,以追踪公共部门劳动力规模的长期演变趋势。经典应用包括构建固定效应或随机效应模型,探究公共就业政策在不同性别群体及城乡区域间的差异化影响,亦可用于时间序列预测,为劳动经济学领域的宏观比较研究提供结构化支撑。
实际应用
实际应用中,该数据对国际组织与政府智库的劳动力政策评估具有直接价值。政策制定者可利用性别与城乡交叉分组数据,监测公共部门就业的均衡性,识别特定群体在公共服务岗位中的代表性不足问题。以欧盟为例,该数据集有助于评估区域就业战略中公共部门对女性就业的促进效果,并为农村地区公共服务岗位的优化配置提供量化参考,推动包容性就业政策的精准落地方案形成。
衍生相关工作
该数据集衍生出一系列以ILOSTAT为核心的劳动统计分析工作。经典成果包括构建欧洲公共就业趋势的指数分解模型,量化性别与地域维度对就业变动的贡献率;亦催生了结合机器学习方法的公共就业影响因素预测研究。此外,研究者基于此数据展开了跨国公共财政与劳动力效率的比较研究,推动了统计口径统一下公共部门就业数据的再分析方法进展,成为连接微观调查与宏观政策的桥梁性资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务