遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-geo-cur-nb-average-hourly-earnings-of-employees-by-sex-rural

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格型数据集,包含欧洲5个国家(法国、摩尔多瓦、瑞士、波黑、希腊)从2000年至2025年的平均小时收入数据,总计2,124个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,核心指标为按性别、城乡地区和货币分类的雇员平均小时收入。数据集以结构化表格形式组织,涵盖国家代码、性别分类(总计、男性、女性)、年份、观测值等列,适用于表格分类、回归或时间序列预测任务。数据通过ILOSTAT API获取,并经过欧洲ISO3国家代码过滤,确保数据覆盖欧洲区域。

This dataset is a tabular dataset containing 2,124 observations of average hourly earnings data across 5 European countries (France, Moldova, Switzerland, Bosnia and Herzegovina, Greece) from 2000 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, with the core indicator being Average hourly earnings of employees by sex, rural/urban areas and currency. The dataset is organized in a structured table format, including columns such as country code, sex classification (total, male, female), year, observed value, etc., and is suitable for tabular classification, regression, or time-series forecasting tasks. Data is retrieved via the ILOSTAT API and filtered by European ISO3 country codes to ensure European coverage.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-geo-cur-nb-average-hourly-earnings-of-employees-by-sex-rural 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,聚焦于欧洲地区雇员平均时薪的性别与城乡差异。构建过程通过调用ILOSTAT的REST API,精准提取了指标代码为EAR_EHRA_SEX_GEO_CUR_NB的数据,并依据欧洲ISO3国家代码进行地理过滤。原始数据来源涵盖劳动力调查、家庭收入调查及行政记录,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一化处理,确保了数据口径的标准化与跨国的可比性。最终数据集以Parquet格式封装,由Electric Sheep Europe团队完成清洗与重塑,包含2124条观测记录,跨越5个欧洲国家、时间跨度为2000至2025年。
特点
本数据集的核心特点在于其精细的多维分类体系与权威溯源属性。除了基础的性别维度(涵盖总计、男性、女性三类),还引入了城乡区域分类与货币种类变量,为研究劳动力市场的结构性差异提供了宝贵素材。数据集中包含‘source.label’与‘obs_status’等元数据列,清晰标注了数据来源与观测状态(如序列中断、临时值等),便于用户进行数据质量评估。此外,数据集以年度频次呈现,避免了高频数据带来的噪声,便于开展长期趋势分析与面板数据建模,特别适用于经济学、劳动社会学与政策评估领域的实证研究。
使用方法
使用该数据集极为便捷,用户可通过HuggingFace的datasets库以一行代码加载:load_dataset('electricsheepeurope/europe-ilo-ear-ehra-sex-geo-cur-nb-average-hourly-earnings-of-employees-by-sex-rural'),并自动转换为pandas DataFrame进行后续分析。推荐的使用流程包括:按国家或性别字段进行筛选以聚焦特定子群体;针对单一指标按时间排序后绘制时序图;利用透视表功能构建国家×年份的矩阵,便于进行面板回归或聚类分析。数据集遵循CC-BY-4.0许可协议,使用时应同时引用ILO原始数据来源与Electric Sheep Europe的重封装版本,以确保学术规范与数据追溯的完整性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的统计数据库ILOSTAT提供,并由Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台上。数据聚焦于欧洲5个国家(法国、摩尔多瓦、瑞士、波黑、希腊)2000年至2025年间按性别、城乡区域和货币划分的雇员平均时薪,共包含2124条观测记录。ILOSTAT作为全球劳动统计领域的权威来源,通过整合各国劳动力调查、家庭收入调查及行政记录等数据,为研究劳动力市场中的工资差异、性别不平等及区域发展不均衡等核心问题提供了系统性的量化基础。该数据集在劳动经济学、政策评估及可持续发展目标(SDG)监测方面具有重要影响力,尤其为跨国比较和时序分析提供了标准化、可复用的数据资源。
当前挑战
该数据集面临多重挑战。一是所解决的领域问题:劳动经济学中,不同国家间工资统计口径不一(如货币单位、调查方法、数据质量),使得跨国可比性难以保证;同时,性别和城乡维度的数据稀疏性限制了对于工资差距的结构性分析。二是构建过程中的挑战:原始数据来源多样(劳动力调查、行政记录),需通过ILO统一的ICLS定义进行标准化整合,但部分观测值存在连续性中断(如“Break in series”标记)或数据来源变更,影响时序分析的可靠性;此外,数据集仅覆盖5个国家且部分国家数据年代跨度较短(如希腊仅涵盖2015-2020年),样本量有限,难以推广至整个欧洲区域。
常用场景
经典使用场景
该数据集收录了欧洲五个国家2000至2025年间按性别、城乡区域及货币单位分类的雇员平均时薪数据,共计2124条观测值。其经典使用场景涵盖基于表格数据的分类与回归任务,例如构建性别薪酬差异的预测模型,或利用时间序列分析方法探究欧洲劳动力市场薪酬的演变规律。研究者可借此分析不同地理区域与性别群体的收入分布特征,亦可将该数据集作为多维度经济指标的基准,用于验证薪酬公平性假设及区域经济发展理论。
衍生相关工作
该数据集衍生出的经典工作包括基于时间序列分解的薪酬趋势预测研究,通过整合性别人工变量与区域分类特征,发展出兼顾经济周期与结构性因素的混合预测模型。另一类代表性工作聚焦于薪酬公平性审计,利用分类算法识别系统性歧视模式,并拓展出可解释性机器学习框架以揭示性别薪酬裂口的驱动因素。此外,该数据集还被用于构建欧洲薪酬基准图谱,催生了多国家多指标联动的聚类分析工具,为后续劳动经济学中跨国薪酬比较方法论的发展奠定了数据基础。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲五国(法国、摩尔多瓦、瑞士、波黑、希腊)2000至2025年间按性别和城乡地域划分的雇员平均时薪,源自国际劳工组织(ILO)的ILOSTAT数据库。当前前沿研究方向包括利用时间序列模型预测后疫情时代欧洲劳动力市场的工资性别差距演变,并结合城乡差异评估政策干预效果。该数据集与ILO倡导的体面劳动目标(SDG 8)紧密相连,为跨国的性别平等和区域发展研究提供了标准化、可复现的微观数据基础,有助于揭示工资结构中的系统性不平等,推动基于证据的社会经济决策。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务