遇见数据集

electricsheepeurope/europe-ilo-ear-xfls-noc-rt-female-share-of-low-pay-earners

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲28个国家女性低薪收入者占比(%)的表格数据集,包含278个观测值,时间跨度为1991年至2025年,涵盖1个具体指标(EAR_XFLS_NOC_RT)。数据来源于国际劳工组织(ILOSTAT)的官方数据库,涉及收入和薪酬不平等主题,适用于表格分类、回归和时序预测等任务。数据集经过Electric Sheep Europe重新打包,以Parquet格式提供,便于机器学习使用。

This dataset contains 278 observations of the female share of low pay earners (%) across 28 European countries, spanning from 1991 to 2025, covering 1 distinct indicator (EAR_XFLS_NOC_RT). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), focusing on income and pay inequality, and is repackaged by Electric Sheep Europe for machine learning applications in tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-xfls-noc-rt-female-share-of-low-pay-earners 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接提取指标代码为EAR_XFLS_NOC_RT的原始数据,并依据欧洲国家ISO3代码进行地理范围过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,数据来源在source.label列中予以标注,以确保数据的可追溯性。最终由Electric Sheep Europe团队重新打包为HuggingFace数据集,共收录28个欧洲国家、时间跨度为1991年至2025年的278条观测记录。
特点
该数据集聚焦于女性低收入就业者占比这一关键指标,反映了欧洲地区收入与薪酬不平等领域的性别差异。数据涵盖28个欧洲国家,时间跨度长达35年,具有典型的跨国家面板数据特征。每条记录包含国家代码、来源标签、观测值、观测状态及注释信息等丰富字段,便于用户进行数据质量评估与筛选。值得注意的是,数据集中的观测值来自ILO选定的最佳来源,且当同一国家年份存在多个来源时仅采用最优者,从而保证了数据的一致性与可靠性。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,使用load_dataset函数即可快速获取完整数据并转换为Pandas DataFrame格式。支持按国家代码过滤实现特定国家的子集分析,也可针对单一指标进行时间序列排序与可视化。此外,数据集的列结构允许用户轻松构建以年份为行、国家为列的透视表,便于开展面板数据分析与跨国家比较研究。所有数据均以CC-BY-4.0许可发布,使用时需同时引用ILO原始数据和Electric Sheep Europe的重新打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Europe重新整理后托管于HuggingFace平台,聚焦于欧洲地区女性低薪劳动者占比(%)的指标。其核心研究问题在于量化女性在低收入群体中的代表性,以揭示劳动力市场中基于性别的薪酬不平等现象。数据集覆盖1991年至2025年间28个欧洲国家的278条观测记录。作为ILOSTAT数据库的重要子集,该数据集为劳动经济学、性别平等政策和国际比较研究提供了标准化、可复用的时序数据,推动了低薪陷阱与性别收入鸿沟等议题的实证分析,在学术研究与政策评估中具有显著影响力。
当前挑战
该数据集所解决的领域挑战在于劳动力市场中性别薪酬不平等的量化困境——尤其在政策制定中需要可比较的历史数据以评估干预效果。具体挑战包括:1)跨国家数据可比性,各国调查问卷与统计口径差异(如就业定义、低薪阈值设定)导致统一标准的压力;2)数据稀疏性与断点问题,部分国家观测序列不连续或标注为断裂(如'Break in series'),影响趋势分析与模型训练;3)多源数据整合中的质量异构性,ILO虽选取'最佳来源',但标注状态(如provisional、unreliable)仍需手动过滤;4)元数据复杂性,注释列(如note_indicator、note_source)隐含的数据收集范围变化(如排除自雇者)需研究者仔细解析以避免偏误。
常用场景
经典使用场景
该数据集收录了1991年至2025年间28个欧洲国家女性低薪工作者占比的年度观测值,共计278条记录,是研究欧洲劳动力市场中性别收入不平等的关键量化资源。其最经典的用途在于构建时间序列模型,追踪各国女性低薪比例的历史演变轨迹,并借助面板数据分析框架,探索经济发展阶段、劳动政策变革与性别薪酬差距之间的动态关联。研究者常通过固定效应模型或随机效应模型,控制国家异质性与时间趋势,以识别影响女性低薪风险的结构性因素,为后续的政策模拟与因果推断奠定数据基础。
解决学术问题
性别收入差距是劳动经济学与社会分层研究中的核心议题,该数据集直接回应了女性在低薪岗位中代表性过高的量化困境。学术上,它解决了跨国家、长时段比较的难题——以往研究受限于各国统计口径差异与数据碎片化,难以系统评估欧洲层面女性低薪比例的收敛或发散趋势。利用这一标准化数据,学者能够检验人力资本理论、劳动力市场分割理论以及制度主义流派关于最低工资、集体谈判权益与性别平等政策效果的实证假说。其意义在于推动性别不平等研究从个案描述迈向跨国计量分析,为国际劳工组织及欧盟的体面劳动议程提供可复现的经验证据。
衍生相关工作
围绕这一核心指标,学术界涌现了一系列延伸性研究工作。一方面,研究者将其与ILOSTAT其他指标(如性别工资中位数比、女性就业率、临时工作占比)联动,构建多维性别劳动平等指数,用于国家间综合排名与聚类分析。另一方面,该数据频繁嵌入关于欧盟东扩、2008年金融危机及新冠疫情冲击的劳动市场韧性研究中,作为衡量危机期间弱势群体受创程度的关键变量。近期前沿工作尝试利用贝叶斯结构时间序列模型,基于该数据集预测未来女性低薪比例,并结合因果森林方法识别不同国家政策干预的异质性处理效应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务