遇见数据集

electricsheepeurope/europe-ilo-eip-xplf-sex-mts-nb-potential-labour-force-by-sex-and-marital-status-t

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含按性别和婚姻状况划分的潜在劳动力(以千为单位)数据,覆盖20个欧洲国家,时间跨度为1987年至2025年,共计7,913个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题为劳动力未充分利用的其他指标,具体指标为EIP_XPLF_SEX_MTS_NB(潜在劳动力按性别和婚姻状况统计)。数据集由Electric Sheep Europe重新打包,旨在提供统一的、机器学习就绪的欧洲数据层。数据字段包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类(总计、男性、女性)、婚姻状况分类、年份、观测值、观测状态和相关注释等。数据集适用于表格分类、回归和时间序列预测等自然语言处理任务,支持研究人员和开发者快速加载和使用。

This dataset contains data on the potential labour force by sex and marital status (in thousands) across 20 European countries, spanning from 1987 to 2025, with a total of 7,913 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, under the topic Other measures of labour underutilization, specifically the indicator EIP_XPLF_SEX_MTS_NB (Potential labour force by sex and marital status). It has been repackaged by Electric Sheep Europe to provide a unified, ML-ready data layer for Europe. The dataset includes fields such as country code, country name, data source, indicator code, indicator name, sex classification (total, male, female), marital status classification, year, observed value, observation status, and related notes. It is suitable for tabular classification, regression, and time-series forecasting tasks in NLP, enabling researchers and developers to quickly load and utilize the data.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-xplf-sex-mts-nb-potential-labour-force-by-sex-and-marital-status-t 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,Electric Sheep Europe团队通过ILOSTAT REST API直接抓取了指标EIP_XPLF_SEX_MTS_NB的原始数据,并根据欧洲ISO3国家代码进行了筛选和过滤。ILOSTAT本身基于国际劳动统计学家会议(ICLS)的定义,对各国劳动力调查、家庭收入调查等微观数据进行协调处理,确保跨国的可比性。数据以Parquet格式重新封装,并整合了性别、婚姻状况等细分维度,共包含7,913条观测记录,覆盖1987年至2025年间的20个欧洲国家。
特点
此数据集聚焦于“潜在劳动力”(Potential labour force)这一衡量劳动力利用不足的关键指标,以千人为单位呈现。其核心特色在于提供了按性别和婚姻状况划分的详细维度,其中性别包括总人口、男性、女性三类,而婚姻状况通过分类变量classif1进行标识。数据时间跨度近四十年,覆盖了东欧、西欧、南欧等多个区域,为国家间的比较分析奠定了基础。此外,数据集还附带了观测状态标志和源注释,便于用户甄别数据的可靠性与方法变化。
使用方法
用户可通过HuggingFace的`datasets`库便捷加载数据,仅需一行代码`load_dataset("electricsheepeurope/europe-ilo-eip-xplf-sex-mts-nb-potential-labour-force-by-sex-and-marital-status-t")`即可获得训练集。加载后数据可转换为Pandas DataFrame,进而实现多种分析,例如按国家筛选进行国别研究、按时间序列绘制特定指标的变化趋势、或利用数据透视表构建国家×年份的观测矩阵。对于分类或回归任务,可直接利用`sex`、`classif1`等作为特征,`obs_value`作为目标变量进行建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe于2025年重新整理后在Hugging Face平台发布,聚焦欧洲20个国家1987至2025年间潜在劳动力按性别与婚姻状况(千人为单位)的统计数据。核心研究问题在于揭示未充分就业群体的结构性特征,为劳动力市场分析、政策评估及性别平等研究提供精细化数据支撑。作为ILOSTAT数据库的衍生应用,该数据集整合了多国劳动调查与行政记录,其标准化处理提升了跨时期、跨国别的可比性,对劳动经济学、社会政策及时间序列预测等领域具有重要参考价值。
当前挑战
该数据集的构建与应用面临多重挑战。首先,劳动力未充分利用的测量本身具有复杂性,不同国家调查方法、定义标准(如ICLS准则)及数据源质量存在差异,导致时间序列的连贯性与跨区域可比性难以保障,如数据中标注的'序列中断'、'方法修订'等异常值需谨慎处理。其次,原始数据整合过程中需将多来源、多粒度的微观数据统一为年度频率并筛选最佳源,这要求严格的归因与清洗策略,同时涉及时区、编码体系及缺失值处理等工程化难题,以确保机器学习就绪的表格格式与时间序列分析的有效性。
常用场景
经典使用场景
在劳动经济学与社会科学研究领域,该数据集的核心应用在于对欧洲各国潜在劳动力人口进行精细化的分类分析。研究者可借助其中按性别与婚姻状况划分的年度观测数据(1987-2025年,覆盖20国),构建面板数据模型,深入探讨劳动力参与率的变动趋势及其结构性差异。其典型的分析范式包括:利用时间序列分解技术识别潜在劳动力的周期性波动,或通过固定效应模型控制国家层面异质性,量化婚姻状况对不同性别群体劳动供给行为的差异化影响。数据集的国际化编码与本地化指标标签并存的特征,亦使得跨国比较与元分析得以顺畅开展。
解决学术问题
该数据集精准回应了劳动经济学中关于“劳动力利用不足”的经典测度难题。通过提供国际劳工组织(ILO)统一口径下的“潜在劳动力”指标,它使研究者得以突破传统失业率统计的局限,捕捉到那些因家庭责任或社会规范而被边缘化的隐性劳动供给群体。具体而言,数据中按性别与婚姻状况的交叉分类,为解决“灰心丧气工人效应”的性别差异、婚姻对女性劳动力参与的门槛效应以及生育政策对潜在劳动力池的长期影响等学术争议提供了实证基础。这不仅验证了I-O模型在劳动力市场分割理论中的应用,更推动了社会分层与性别不平等研究的量化范式革新。
衍生相关工作
基于该数据集的经典衍生工作已形成丰富的学术脉络。一方面,劳动经济学领域以此为基准发展了诸多关于“劳动力市场松弛度”的代理指标,例如将潜在劳动力数据与长期失业率结合构造“广义失业率”指数,发表于《劳动经济》等期刊。另一方面,社会学与人口学的交叉研究中,该数据集被用于构建欧洲国家“婚姻-劳动脱钩”的时空面板,探讨二战后家庭形态变迁对劳动供给弹性的跨国异质性影响。在计算社会科学方向,部分研究将其纳入基于Agent的模拟模型(如JAS-mine平台),以预测不同婚姻解体率情景下的劳动力再分配效应,进一步拓展了微观行为分析与宏观政策评估的对话空间。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务