遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-eco-cur-nb-average-monthly-earnings-of-employees-by-sex-econo

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了欧洲41个国家从1969年至2025年的191,287个观测值,涵盖一个核心指标:按性别、经济活动和货币分类的员工月平均收入。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过筛选仅包含欧洲国家。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类、经济活动和货币分类、观测年份、观测值、数据状态标志以及相关注释。数据以年度频率发布,经过ILO的标准化处理,确保与国际劳工统计学家会议(ICLS)定义一致。数据集适用于表格分类、表格回归和时间序列预测等任务,可用于劳动力市场分析、收入趋势研究等。

This dataset contains 191,287 observations of average monthly earnings of employees by sex, economic activity and currency, covering 41 European countries from 1969 to 2025. It includes one distinct indicator (EAR_EMTA_SEX_ECO_CUR_NB), sourced from the ILOSTAT database of the International Labour Organization (ILO). The data is pulled via the ILOSTAT REST API, filtered to European ISO3 country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The schema includes columns such as ref_area (country code), indicator, sex disaggregation (total, male, female), economic activity classification, currency classification, time (year), obs_value (observed value), and various status and note fields. The dataset is annual frequency and designed for tabular classification, regression, and time-series forecasting tasks, supporting labor market and earnings analysis.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-eco-cur-nb-average-monthly-earnings-of-employees-by-sex-econo 数据集图片
构建方式
该数据集源自国际劳工组织ILOSTAT数据库,通过其REST API直接抽取特定指标(EAR_EMTA_SEX_ECO_CUR_NB)的原始数据,并利用Electric Sheep Europe的自动化管道进行清洗、重整与标准化处理。数据过滤范围限定于欧洲41个国家的ISO3代码,保留了调查来源、性别、经济活动分类及货币等关键维度。针对同一国家与年份存在多个数据源的情况,采用ILO选定的‘最佳来源’以确保数据一致性,最终以Parquet格式封装,形成约19.1万条观测记录的机器学习就绪数据集。
使用方法
用户可通过HuggingFace的`datasets`库直接加载数据集,使用`load_dataset("electricsheepeurope/europe-ilo-ear-emta-sex-eco-cur-nb-average-monthly-earnings-of-employees-by-sex-econo")`一行代码获取训练集,并可便捷地转换为Pandas DataFrame进行后续操作。建议根据研究需求按国家(`ref_area`)筛选子集,或对特定指标按时间排序后进行时间序列可视化。亦可利用`pivot_table`将数据重塑为国家×年份的矩阵形式,便于面板数据分析和回归建模,满足经济统计与劳动经济学领域的多样分析场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe于2025年重新整理并发布于HuggingFace平台。其核心研究问题聚焦于欧洲地区按性别、经济活动和货币划分的雇员月均收入,旨在为劳动经济学、性别薪酬差距分析及跨国劳动力市场比较提供标准化数据基础。数据集涵盖41个欧洲国家、1969年至2025年的191,287条观测记录,凭借ILOSTAT作为全球劳动统计权威数据库的声誉,该数据集在劳动经济学、社会政策评估及可持续发展目标(SDG)监测领域具有显著影响力,尤其为研究工资动态、性别平等及经济结构转型提供了关键实证支撑。
当前挑战
该数据集致力于解决的领域问题包括:1)跨国家与跨时期薪酬数据的不可比性——不同国家的调查方法、货币单位及经济活动分类标准存在差异,ILO通过国际劳工统计学家会议(ICLS)定义进行数据协调,但仍存在数据质量标记(如不可靠值)与分类维度不完整的问题;2)性别薪酬差异的精细刻画——数据集虽按性别分解,但缺乏与职业、教育或工作经验的交叉分类,难以全面揭示薪酬不平等的深层驱动因素。构建过程中面临的挑战主要涉及多源数据整合(包括劳动力调查、行政记录等),需处理缺失值、不同来源的优先级选择以及年度频率与月度/季度数据之间的时态差异,同时需维护庞大的元数据体系(如来源标签、观察状态标记)以确保可追溯性。
常用场景
经典使用场景
在欧洲劳动经济学与公共政策研究领域,europe-ilo-ear-emta-sex-eco-cur-nb-average-monthly-earnings-of-employees-by-sex-econo数据集凭借其跨越1969年至2025年、涵盖41个欧洲国家的191,287条观测记录,成为分析性别薪酬差异随时间演变的经典素材。研究者常利用其按性别分层的月均收入数据,结合经济活动和货币类别维度,构建面板数据模型以量化性别收入差距的长期趋势、收敛速度及其与宏观经济周期的关联。该数据集亦适用于时间序列预测任务,可基于各国历史薪酬序列,运用ARIMA或深度学习算法预判未来收入分布格局,为劳动力市场结构性变迁提供数据驱动的洞察。
解决学术问题
该数据集有效回应了劳动经济学领域关于性别收入不平等为何在发达经济体依然顽固存在的核心学术追问。通过整合多国标准化的薪酬微观数据,它使得研究者能够剥离职业、行业及货币异质性干扰,聚焦于性别这一单一维度对收入的净效应,从而检验歧视理论、人力资本理论与制度主义框架在不同政策环境下的解释力。其跨国纵向覆盖的特性还支持在控制国家固定效应与时间趋势后,评估欧盟平等待遇指令、育儿假政策及集体谈判制度对缩小性别薪酬差距的真实因果效应,填补了既有研究因数据碎片化而难以开展比较分析的空白,推动政策评估从描述性统计迈向严谨的计量推断。
实际应用
在实际应用层面,该数据集为欧洲各国劳动部门及国际组织(如国际劳工组织、欧盟统计局)提供了监测就业质量与公平性的量化工具。政策制定者可借助其中的月度收入指标,按性别与经济活动交叉分类,精准定位薪酬最低或性别差异最激进的行业,从而设计有针对性的工资透明化法规或职业培训补贴方案。跨国企业亦能利用该数据对标不同国家运营属地的人工成本与性别平等合规水平,优化薪酬策略与ESG报告中的社会绩效披露。此外,数据挖掘与可视化开发人员可通过其规整的模式构建交互式经济仪表盘,使公众直观感知本国薪酬水平在区域中的相对位置与历史变迁。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲41个国家1969至2025年间按性别、经济活动与货币划分的雇员平均月收入,为劳动经济学中的性别薪酬差异、劳动力市场结构性变迁以及跨国收入趋同研究提供了高颗粒度的时序证据。在欧盟推动《薪酬透明度指令》与ILO倡导体面劳动指标的背景下,研究者正利用此数据构建面板模型,评估经济一体化进程中性别工资鸿沟的演变轨迹,并借助机器学习的插补方法处理缺失观测值与异质性来源标记,以揭示制度变迁、产业重组与汇率波动对实际收入分布的多层影响。数据集在ILOSTAT框架下的标准化字段设计使其易于与就业率、工作时长及社会保障等变量联合分析,从而为追踪欧洲劳动力市场的包容性发展及评估企业薪酬透明度政策效果提供可靠的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务