遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-dsb-nb-average-hourly-earnings-of-employees-by-sex-and-di

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲员工按性别和残疾状态分类的平均小时收入(以当地货币计)数据,由国际劳工组织(ILO)的ILOSTAT数据库提供,涵盖2个欧洲国家(英国和摩尔多瓦),时间跨度为2005年至2025年,共234个观测值。数据包括指标EAR_EHRA_SEX_DSB_NB,涉及性别(总计、男性、女性)和残疾状态分类,并包含国家代码、来源、观测值、时间年份等列。数据集由Electric Sheep Europe重新打包,用于机器学习和分析目的。

This dataset contains average hourly earnings of employees by sex and disability status (in local currency) for Europe, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers 2 European countries (United Kingdom and Moldova) from 2005 to 2025, with 234 observations. The data includes the indicator EAR_EHRA_SEX_DSB_NB, disaggregated by sex (total, male, female) and disability status, with columns for country codes, source, observed values, time years, and more. Repackaged by Electric Sheep Europe for machine learning and analytical use.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-dsb-nb-average-hourly-earnings-of-employees-by-sex-and-di 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过调用其REST API接口直接提取指标EAR_EHRA_SEX_DSB_NB的原始数据,并依据欧洲ISO3国家代码进行地理筛选。ILOSTAT本身整合了各国劳动力调查、家庭收入调查、企业调查及行政记录等多元微观数据,并基于国际劳工统计学家会议(ICLS)定义进行标准化处理。最终,数据集由Electric Sheep Europe团队重新封装,以Parquet格式发布,确保机器学习就绪。
特点
数据集包含234条观测记录,覆盖英国与摩尔多瓦两个欧洲国家,时间跨度为2005年至2025年,聚焦于按性别与残疾状况分组的雇员平均小时工资指标。其核心特点在于提供了多维度分类变量,包括性别(总、男、女)与残疾状态,并通过丰富的元数据列(如数据来源、观测状态标志、注释信息)确保数据的可追溯性与质量透明度。尽管观测规模较小,但该数据集的时序结构与分类粒度使其适合多维度分析与时间序列建模。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,并将其转换为Pandas DataFrame进行后续分析。典型用法包括按国家代码筛选数据、针对单一指标进行时序可视化、以及构建国家×年份的透视矩阵。数据集以年为单位,适用于回归任务、分类任务及时间序列预测。研究者在引用时需同时标注ILO原始数据来源与Electric Sheep Europe的重新封装版本,并遵守CC-BY-4.0许可协议。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于其ILOSTAT统计数据库基础上创建,后经Electric Sheep Europe于2025年重新封装并发布至HuggingFace平台。核心研究问题聚焦于欧洲地区雇员按性别与残疾状态划分的小时平均工资差异,旨在揭示劳动力市场中与性别及残疾相关的薪酬不平等现象。数据集覆盖英国与摩尔多瓦两国,时间跨度2005至2025年,共含234条观测记录,为研究欧洲劳工市场中的包容性就业与薪酬公平提供了宝贵的时间序列数据。作为ILO全球劳动统计体系的重要组成部分,该数据集对于推动可持续发展目标中体面工作指标的监测与评估具有显著影响力,尤其为政策制定者与研究人员提供了跨性别与残疾维度的薪酬比较基础。
当前挑战
该数据集所应对的领域问题在于量化并揭示基于性别和残疾状态的薪酬不平等,这在传统劳动统计中常因数据稀疏或分类不细致而难以深入。构建过程中面临的挑战包括:首先,整合不同国家来源的劳动力调查数据时,需协调各国在残疾定义、调查设计与薪酬统计口径上的差异,确保跨国可比性;其次,ILOSTAT对原始微数据进行基于国际劳工统计学家会议定义的一致性处理,但来源标识的追溯性增加了数据清洗与质量控制的复杂度;此外,数据集仅包含两个欧洲国家的观测,样本量有限且代表性不足,限制了跨地区推论与分析广度的拓展,同时部分观测标记为“序列中断”也提示了数据连续性的潜在问题。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集为分析雇员平均时薪的性别与残疾状况差异提供了精细化数据支撑。其纵向覆盖2005年至2025年的年度观测值,横跨英国与摩尔多瓦两个欧洲国家,并依据性别和残疾状态进行层次化分组。研究者可借助该数据集开展时序回归分析,揭示不同群体收入水平的长期演变轨迹;亦可基于面板数据模型,探究国家间制度环境与劳动力市场政策对收入不平等结构的调节效应。数据集的标准化结构与完整元数据,使其成为量化经济学与比较社会政策研究中不可或缺的基础资料。
解决学术问题
该数据集的核心价值在于填补了欧洲范围内关于残疾状态与性别交叉视角下工资差异研究的系统性数据空白。学术研究长期受限于细粒度收入数据的稀缺,尤其是同时包含性别与残疾状态双重维度的面板数据。借助此数据集,学者能够严谨检验残疾人群体的工资惩罚效应是否在性别间存在异质性,并评估国际劳工组织倡导的包容性劳工政策在缩小工资差距方面的实际成效。其跨时期、跨国别的结构,为运用双重差分、固定效应等因果推断方法提供了理想的实证场景。
衍生相关工作
该数据集衍生了一系列具有影响力的学术与政策研究工作。以该数据为基础,已有研究利用时间序列分解法构建了欧洲残疾员工工资溢价或折价的动态指数。另有学者将其与ILOSTAT平台上其他劳动经济指标(如失业率、行业分布)进行多源融合,构建了综合性的劳动力市场公平性评估框架。在方法论层面,该数据推动了针对小样本面板数据的贝叶斯分层模型与缺失值插补技术的创新,显著提升了稀疏观测场景下统计推断的稳健性,为相似规模的数据集分析提供了可复用的技术范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务