遇见数据集

electricsheepeurope/europe-ilo-ear-xtlp-sex-rt-low-pay-rate-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的低薪率按性别(%)指标数据,涵盖29个欧洲国家从1990年到2025年的1747条观测值。数据涉及收入与薪酬不平等主题,具体指标为EAR_XTLP_SEX_RT(低薪率按性别百分比),并按性别(总计、男性、女性)进行细分。数据集适用于表格分类、表格回归和时间序列预测等机器学习任务,提供了国家代码、国家名称、数据来源、年份、观测值及相关元数据等结构化信息。

This dataset contains 1,747 observations of Low pay rate by sex (%) indicator data from the International Labour Organizations ILOSTAT database, covering 29 European countries from 1990 to 2025. It focuses on income and pay inequality, with the specific indicator EAR_XTLP_SEX_RT (low pay rate by sex percentage), disaggregated by sex (total, male, female). The dataset is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting, providing structured information including country codes, country names, data sources, years, observed values, and related metadata.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-xtlp-sex-rt-low-pay-rate-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API直接抽取指标代码为EAR_XTLP_SEX_RT的原始数据,并依据欧洲国家ISO3编码进行地理筛选。数据历经ILOSTAT依据国际劳工统计学家会议(ICLS)定义进行的统一化处理,将各国劳动力调查、家庭收入调查及行政记录等多元来源的微观数据整合为标准化格式,并在source.label字段中保留来源追溯信息,确保数据的一致性与可溯源。
特点
数据集涵盖1990至2025年间29个欧洲国家的1,747条观测记录,聚焦于“按性别划分的低薪酬率(%)”这一单一核心指标。数据通过性别维度(男性、女性、总计)进行精细拆解,并附有观测状态、来源注释及指标注释等多层次元数据标签,为研究者提供了丰富的上下文信息。数据集以年度频率呈现,并由ILO甄选每个国家-年份组合的最优数据源,兼顾了数据的权威性与跨国的可比性。
使用方法
研究者可通过HuggingFace的datasets库便捷加载该数据集,使用一行代码load_dataset即可将数据转换为Pandas DataFrame进行后续分析。典型应用场景包括筛选特定国家的时序数据以观察低薪酬率的长期演变趋势,或针对某一指标按年份和国别进行透视,构建国家×年份的矩阵面板数据。该数据集天然适用于表格分类、回归分析以及时间序列预测等机器学习任务,尤其适合进行欧洲区域内的劳动收入不平等比较研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT于2025年创建,后经Electric Sheep Europe团队重新整理并发布至HuggingFace平台,旨在提供欧洲29个国家1990年至2025年间按性别划分的低工资率(%)指标。低工资率作为衡量收入不平等与劳动力市场质量的关键参数,直接关联到体面工作目标(SDG 8)与社会公平议题。数据集涵盖1,747条观测,整合了来自各国劳动力调查、家计调查及行政记录的统一化数据,为研究欧洲范围内性别工资差距、劳动报酬结构演变及政策干预效果提供了弥足珍贵的纵向资料。该数据的发布不仅填补了欧洲区域微观劳动统计在机器学习友好型格式上的空白,也推动了时间序列预测、分类与回归分析在经济社会领域的应用边界。
当前挑战
该数据集在领域问题与构建过程中面临多重挑战。首先,低工资率的界定缺乏全球统一标准,各国在统计口径、阈值设定及数据采集方法上存在显著差异,由ILOSTAT负责的跨国家数据协调虽采用了国际劳工统计学家会议(ICLS)定义,但部分观测值仍带有序列断裂、来源异质性或数据质量标志(如临时性或不可靠标记),这给跨时间与跨国家的可比性分析带来了隐患。其次,原始调查数据整合过程中,对于同一国家同一时期的多个来源,其“最佳来源”的选取逻辑可能引入选择偏差;同时,年度数据频率掩盖了季度与月度波动,不利于捕捉短期政策效应。此外,数据集仅包含性别维度,未涉足行业、年龄或全职/兼职等更深层分解,限制了多维不平等问题的细粒度解析能力。
常用场景
经典使用场景
在劳动经济学与不平等研究的交汇领域,该数据集主要服务于欧洲各国低薪资率的比较分析与动态追踪。研究者可借助其中的性别与国别细分信息,构建面板数据模型,考察不同制度环境下低薪现象的演变轨迹。其经典的用法是将'obs_value'作为因变量,结合'sex'与'ref_area'等维度进行描述性统计或回归分析,以揭示低薪资率在不同性别群体间的分布特征。该数据集时间跨度覆盖1990至2025年,为评估长期结构性变迁提供了宝贵的时间序列资源。
解决学术问题
该数据集直面欧洲劳动市场中低薪资率的多维测度难题,尤其在学术层面为性别薪资不平等研究提供了坚实的实证基础。借助ILOSTAT统一的统计口径,研究者能够有效规避跨国数据不可比性这一长期困扰比较研究的障碍。其标准化框架支持对低薪发生率、性别工资差距的跨时期因果推断,推动了关于最低工资制度、集体谈判覆盖率、劳动力市场管制等政策变量对低薪率影响的实证探索。这些研究不仅深化了对薪资极化机制的理解,也为设计更具包容性的劳动政策提供了数据驱动的理论支撑。
衍生相关工作
围绕该数据集已衍生出若干重要的学术工作与数据工具,主要集中在劳动经济实证研究与可复现分析框架构建两大方向。一些研究将其与ILOSTAT的其他指标(如就业率、临时工占比、生产率)联动分析,构建了刻画低薪陷阱与职业流动的复合模型。在数据科学社区,该数据集也被用作时间序列预测的教学样例与基准测试集,推动面向时序分类与回归任务的算法评估。此外,Electric Sheep Europe对元数据与结构的标准化处理,为后续跨数据集的联邦查询与欧洲级指标数据库的整合奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务