遇见数据集

electricsheepeurope/europe-ilo-emp-2fte-sex-jbf-nb-full-time-equivalent-employment-by-sex-ilo-modelle

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含按性别划分的全职等效就业数据,基于国际劳工组织(ILO)的模型估计(2025年11月更新,单位为千)。数据覆盖欧洲39个国家,时间跨度为2005年至2027年,包含5,346个观测值。核心指标为EMP_2FTE_SEX_JBF_NB,即按性别分解的全职等效就业估计值。数据来源于ILOSTAT数据库,通过ILO的REST API获取,并经过统一处理,遵循国际劳工统计学家会议(ICLS)定义。数据集按性别维度(总计、男性、女性)提供分类数据,包含国家代码、年份、观测值、数据来源和质量标志等字段。数据为年度频率,适用于表格分类、回归和时间序列预测等机器学习任务。数据集由Electric Sheep Europe重新打包,以标准化模式提供,便于通过HuggingFace的load_dataset()快速加载使用。

This dataset contains gender-disaggregated full-time equivalent (FTE) employment data based on model-based estimates from the International Labour Organization (ILO), updated in November 2025 with units in thousands. Covering 39 European countries and spanning the period from 2005 to 2027, the dataset includes 5,346 observations. The core indicator is EMP_2FTE_SEX_JBF_NB, which refers to gender-disaggregated full-time equivalent employment estimates. The data is sourced from the ILOSTAT database, obtained via the ILO's REST API, and has undergone unified processing in accordance with the definitions set by the International Conference of Labour Statisticians (ICLS). The dataset provides categorized data across gender dimensions (total, male, female), and includes fields such as country code, year, observation value, data source, and quality flag. With an annual frequency, this dataset is suitable for machine learning tasks including tabular classification, regression, and time series forecasting. Repackaged by Electric Sheep Europe, the dataset is provided in a standardized format to enable quick loading and usage via Hugging Face's load_dataset() function.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-2fte-sex-jbf-nb-full-time-equivalent-employment-by-sex-ilo-modelle 数据集图片
构建方式
该数据集由Electric Sheep Europe团队通过ILOSTAT REST API接口直接获取原始数据,并经过精心筛选与整合而成。ILOSTAT作为国际劳工组织的核心统计数据库,汇集了来自各国劳动力调查、家庭收入调查、企业调查及行政记录等多源数据,并依据国际劳工统计学家会议(ICLS)的统一定义进行标准化处理。数据集聚焦于欧洲39个国家的“按性别划分的全时当量就业人数”这一关键指标,时间跨度覆盖2005年至2027年,共计5346条观测记录。在构建过程中,团队对数据来源进行了标注,以确保其可追溯性,并最终以Parquet格式封装,便于机器学习场景下的高效访问与加载。
特点
该数据集最为显著的特点在于其高度的结构化与多维细分能力。它仅包含一个核心指标,即全时当量就业人数,但通过“性别”维度(包括总计、男性、女性三个类别)提供了深度的分解视角。数据覆盖了从阿尔巴尼亚到英国的39个欧洲国家,确保了广泛的地理代表性。此外,每条记录都附带了丰富的元信息,包括国家代码、数据来源标签、观测状态标识等,为数据质量评估和溯源提供了有力支撑。数据集的时间序列长达23年,包含了历史观测与未来预测值,使其成为研究欧洲劳动力市场长期趋势与性别差异的理想资源。
使用方法
研究者可以轻松通过HuggingFace的`datasets`库加载该数据集,并直接将其转换为Pandas DataFrame进行后续分析。例如,使用`load_dataset`函数即可获取完整数据,随后可通过筛选特定国家代码(如`ref_area` == `DEU`)来聚焦于单一国家的时间序列分析。对于需要跨国家对比的研究,可以利用pivot_table方法将数据重塑为以时间为行、国家为列的矩阵形式。数据集的干净schema设计使得时间序列可视化、回归建模或分类任务都能快速上手,特别适合用于劳动力经济学领域的实证研究或预测模型的训练与验证。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,经Electric Sheep Europe在HuggingFace上重新打包,专注于欧洲39个国家2005至2027年间按性别划分的等全职就业人数(单位:千)。其核心研究问题在于通过ILO的模型估算,揭示欧洲劳动力市场中全职等效就业的性别构成与长期趋势。作为ILOSTAT这一全球劳动统计权威数据库的子集,该数据集为经济学家、政策制定者及社会学家提供了标准化的时序数据,支撑就业政策评估、性别平等研究及劳动力市场建模。其影响力体现在填补了欧洲范围内高一致性、多国可比的就业数据缺口,推动了基于证据的区域劳动力分析。
当前挑战
该数据集面临的核心挑战在于所解决的领域问题:一是性别就业差异的量化分析受限于数据粒度,现有指标仅按总体、男性和女性三分类,无法深入考察年龄、教育或行业等交叠因素对全职等效就业的影响。二是构建过程中,需克服跨国数据源(如各国劳动力调查、行政记录)的异质性,ILO虽通过ICLS定义进行标准化,但原始数据质量、调查频率及统计方法差异仍可能导致估算偏差。此外,边界评估(如2027年预测值)的存在增加了不确定性,且元数据中缺少对模型假设的详细说明,进一步限制了对结果稳健性的验证与复现。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织对欧洲39个国家2005至2027年间全职等效就业人数的权威估算,为时间序列预测与回归分析提供了坚实的数据基础。研究者可借助其按性别细分的观测值,构建长跨度的时序模型,系统捕捉欧洲劳动力市场的结构性演变。其表格化结构完美适配监督学习中的分类任务,例如基于国家、年份与来源特征预测就业波动态势。数据集精心整理的年度频率与一致化元数据,使得跨国家、跨时期的联合建模成为可能,为宏观经济学与劳动力研究的量化探索铺就了清晰路径。
解决学术问题
该数据集直面欧洲劳动力研究中长期存在的跨国家数据可比较性与一致性困局。通过ILO采用的国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调,它彻底消解了不同国家统计口径差异带来的分析障碍。学者得以摆脱数据碎片化困扰,聚焦于性别就业差距的演化规律、经济增长与就业弹性关系等核心议题。基于此数据,研究者能够严谨检验劳动力市场制度的长期效应、考察金融危机或疫情等重大冲击对就业的异质性影响,从而推动比较政治经济学与劳动社会学从理论推演向经验验证的范式跃迁。
衍生相关工作
该数据集不仅是众多实证研究的起点,更是催生了若干标志性衍生工作。最典型的应用包括基于时间序列分解的劳动市场周期分析,研究者从中提炼出欧洲就业的长期趋势、周期波动与暂时性冲击。围绕性别维度的差异,衍生出大量探讨女性就业与经济增长非线性关系的计量作品。在预测科学领域,该数据集被用作训练各种宏观经济预测模型的基础,从经典ARIMA到前沿的深度学习时序网络。同时,它也是构建欧洲就业面板数据库的核心组件,供应给诸如欧盟委员会年度就业报告等权威产出,成为理解现代欧洲劳动市场动态不可或缺的知识基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务