遇见数据集

electricsheepeurope/europe-ilo-ear-xtlp-sex-nb-employees-earning-low-pay-by-sex-thousands

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲16个国家从2007年至2022年的209个观察值,专注于收入与薪酬不平等主题。核心指标为EAR_XTLP_SEX_NB,即按性别统计的低薪员工数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤为欧洲国家代码。数据集提供了按性别(总计、男性、女性)分解的年度时间序列数据,包括国家代码、数据来源、观测年份、观测值等详细列结构。适用于表格分类、回归分析和时间序列预测等自然语言处理任务。数据经过ILO harmonization处理,使用ILO选定的最佳来源,确保数据质量。

This dataset contains 209 observations of income and pay inequality data across 16 European countries, spanning from 2007 to 2022, covering one distinct indicator: Employees earning low pay by sex (thousands) (EAR_XTLP_SEX_NB). The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, extracted via the REST API and filtered to European ISO3 country codes. It provides annual time-series data disaggregated by sex (total, male, female), with detailed columns including country codes, data sources, observation years, and observed values. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks. Data is harmonized by ILO using ICLS definitions, with the best source selected for each country-year combination to ensure quality.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-xtlp-sex-nb-employees-earning-low-pay-by-sex-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,主题聚焦于欧洲地区按性别划分的低薪雇员数量(单位:千人)。数据通过ILOSTAT REST API接口直接抽取,并依据欧洲ISO3国家代码进行地理范围过滤。ILOSTAT遵循国际劳工统计学家会议(ICLS)定义,对原始调查微观数据进行统一协调处理,以确保跨国可比性。数据集由Electric Sheep Europe重新打包整理,共收录2007年至2022年间16个欧洲国家的209条观测记录,涵盖1个核心指标,并以Parquet格式存储,便于机器学习流水线直接调用。
特点
本数据集的一个显著特点在于其精细的性别维度分解,包含'总计'、'男性'和'女性'三个类别,为研究性别薪酬差距提供了关键支撑。数据来源被明确标注在'source.label'字段中,增强了溯源透明度。同时,数据集提供了丰富的元数据列,如指标定义注释和来源注释,有助于用户理解数据质量与潜在偏差。时间跨度为2007至2022年,以年度为频率,能够支持长期趋势分析与面板数据研究。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,一行代码即可将数据集转换为Pandas DataFrame进行探索。推荐过滤至特定国家或指标进行聚焦分析,例如筛选德国数据或仅保留低薪雇员指标。数据集特别适合时间序列分析,可轻松按年份排序并绘制趋势图。此外,利用pivot_table功能可快速构建国家×年份的矩阵面板,便于进行跨国比较或计量经济学建模。该数据集的标准化格式极大降低了数据清洗工作量,使研究者能快速切入核心分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)基于其核心统计数据库ILOSTAT创建,经Electric Sheep Europe于2022年重新打包并发布于HuggingFace平台,聚焦欧洲16个国家2007至2022年间按性别划分的低薪雇员人数(单位:千人)。作为全球劳动统计的权威来源,ILOSTAT整合了各国劳动力调查、行政记录等多源数据,遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集的核心研究问题在于量化欧洲区域收入与薪酬不平等中的性别差异,为劳动经济学、社会政策及可持续发展目标(SDG)研究提供了关键指标。其影响力体现在支撑跨国比较分析、追踪低薪就业的时空演变趋势,以及推动基于证据的公平薪酬政策制定,成为衔接宏观劳动统计与微观机器学习建模的重要桥梁。
当前挑战
该数据集所解决的领域问题主要包括:1)收入与薪酬不平等研究长期面临跨国数据标准不统一、性别维度缺失的困境,该数据集通过ILO官方标准化指标,提供了可比较的低薪就业性别比例数据,但仅有209条观测值且覆盖16国,稀疏性限制了深度时序分析和细粒度建模;2)构建过程中面临多源数据融合的挑战,ILO虽筛选了国家层面的‘最佳来源’,但不同来源的就业定义、抽样方法及覆盖范围存在差异,需通过附注列(如note_indicator.label)追溯数据质量标注,这要求使用者具备复杂的元数据解析能力;3)低薪定义可能随国家政策及时间变化,数据集未直接提供阈值说明,增加了跨时期解释的模糊性,尤其对时间序列预测任务构成隐式约束。
常用场景
经典使用场景
该数据集核心服务于欧洲国家低薪就业群体规模的定量分析,聚焦于按性别维度的低薪雇员数量(千人)的年度观测。研究者可将其作为面板数据进行跨国家、跨时序的比较研究,利用时间序列预测方法建模低薪就业规模的演变趋势,或借助分类与回归任务探究低薪现象与社会经济指标之间的关联。数据集涵盖16个欧洲国家2007至2022年的209条记录,提供了按性别(总、男性、女性)细分的观测值,适合开展劳动经济学中的低薪门槛动态、性别薪酬差距变奏及欧洲一体化进程中劳动力市场结构性变化的实证研究。
衍生相关工作
基于该数据集的衍生工作主要集中于低薪就业的跨国面板回归分析与性别差异的分解研究。经典工作包括采用固定效应模型估计各国制度因素(如工会覆盖率、劳动保护法规)对低薪规模的影响,以及利用Oaxaca-Blinder分解量化可观测特征与不可观测歧视在性别低薪差距中的贡献。另有一些研究借助时间序列因果推断方法,考察最低工资上调对低薪女性就业率的动态效应。在机器学习领域,衍生工作尝试构建随机森林或梯度提升模型以预测低薪风险指数,并通过SHAP值解释关键驱动因素。这些工作共同推进了欧洲就业质量研究的方法论创新,并使低薪问题从描述性统计走向机制性解释。
数据集最近研究
最新研究方向
当前,围绕欧洲低薪就业的性别差异研究正借助ILOSTAT等权威劳工统计数据库,聚焦于时间序列分析与面板数据挖掘,以揭示2007至2022年间16个欧洲国家中按性别划分的低薪雇员规模及其演变趋势。该数据集作为收入与薪酬不平等领域的关键资源,为探究劳动力市场中性别薪酬差距的结构性成因、政策干预效果以及新冠疫情等重大事件对低薪群体的差异化冲击提供了量化基础。前沿方向包括利用机器学习模型对低薪就业的时空分布进行预测,并结合社会经济指标开展多维度归因分析,从而为欧盟及各国制定更具包容性的劳动政策、缩小性别收入鸿沟、实现体面工作目标提供实证支撑与数据驱动的决策依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务