遇见数据集

electricsheepeurope/europe-ilo-ged-pear-sex-hht-chl-nb-average-monthly-earnings-of-prime-age-employees-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲地区(具体为波斯尼亚和黑塞哥维那)的劳动力统计数据,重点关注“黄金年龄段员工平均月收入按性别、家庭类型和子女存在情况”的指标。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,覆盖2001年,共105个观测值。数据集包括国家代码、指标代码、性别分类、家庭类型分类、子女存在情况分类、观测年份、观测值(以当地货币计)等列,并提供了数据来源和质量标志(如不可靠数据标记)。数据经过ILO的标准化处理,适用于表格分类、回归和时间序列预测等任务。

This dataset contains labour statistics for Europe (specifically Bosnia and Herzegovina) focusing on the indicator Average monthly earnings of prime-age employees by sex, household type and presence of children. The data is sourced from the International Labour Organizations ILOSTAT database, covering the year 2001 with 105 observations. It includes columns such as country code, indicator code, sex disaggregation, household type classification, presence of children classification, observation year, observed value (in local currency), and data quality flags (e.g., unreliable data markers). The data is harmonized by ILO and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ged-pear-sex-hht-chl-nb-average-monthly-earnings-of-prime-age-employees-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过调用其REST API,筛选出欧洲地区的ISO3国家代码,并提取了编号为GED_PEAR_SEX_HHT_CHL_NB的指标数据。数据经Electric Sheep Europe重新封装,以Parquet格式发布在HuggingFace平台,确保机器学习就绪。构建过程中,对原始调查微观数据依据国际劳工统计学家会议(ICLS)定义进行了统一化处理,并在source.label列中标注了数据来源,提升了可追溯性。数据集涵盖105条观测记录,涉及1个欧洲国家(波斯尼亚和黑塞哥维那),时间跨度为2001年,包含了按性别、家庭类型及子女情况分类的月均收入信息。
特点
数据集的主要特点在于其精细的分层结构,提供了按性别(男性、女性、总计)、家庭类型及子女年龄分组等多维度交叉分析能力。除了核心的观测值(obs_value)外,每条记录还附带了观测状态标识和详尽的数据来源注释,便于用户评估数据质量。该数据集为年度频率数据,并采用了ILO筛选的“最佳来源”,确保了数据的权威性与代表性。其小而精的设计(仅1个指标、105行记录)使其非常适合作为时间序列分析或表格分类与回归任务的基准数据集。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,使用`load_dataset("electricsheepeurope/europe-ilo-ged-pear-sex-hht-chl-nb-average-monthly-earnings-of-prime-age-employees-by")`命令即可获取训练集。加载后,可将其转换为pandas DataFrame进行后续分析。推荐的使用方式包括:按国家代码过滤特定国家数据,按时间排序绘制特定指标的时序变化图,或通过数据透视表构建以年份为行、国家为列的矩阵。该数据集还支持按性别、家庭类型等分类维度进行分面分析,适用于经济社会学研究中的薪酬差异与劳动力市场结构探讨。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,依托其核心统计数据库ILOSTAT,旨在系统性地收录欧洲地区主要年龄段雇员按性别、家庭类型及子女状况划分的平均月薪数据。数据集发布时间为2001年,覆盖波斯尼亚和黑塞哥维那共105条观测记录,聚焦劳动经济学中薪酬差异这一核心研究问题。作为ILO推动体面劳动与可持续发展目标(SDG)监测的重要工具,该数据集通过标准化分类维度,为跨国薪酬比较、性别工资差距分析及家庭结构对收入影响的研究提供了权威数据支撑,对劳动经济学、社会保障政策制定及国际发展研究领域产生了深远影响。
当前挑战
该数据集所解决的领域问题集中于劳动经济学中薪酬结构性差异的量化分析,特别是性别、家庭类型与子女状况交互作用下工资不平等的实证研究。构建过程中面临的核心挑战包括:不同国家家庭收入调查与劳动力调查在抽样框架、问卷设计及统计定义上的异质性,需通过ILO国际劳动统计学家会议(ICLS)标准进行跨源数据协调;数据质量标注复杂,面临因样本量不足或统计方法差异导致的观测值不可靠(如标记为'U'的状态)问题;多维度分类变量(如家庭类型与子女年龄分组)组合后导致细粒度层级数据稀疏,影响模型估计的统计效力与泛化能力。
常用场景
经典使用场景
该数据集以国际劳工组织ILOSTAT数据库为源,汇集了欧洲国家(如波斯尼亚和黑塞哥维那)壮年雇员的平均月收入信息,并按性别、家庭类型及子女状况进行细致分层。其经典应用场景在于支持劳动经济学中的收入差异分析,研究者可通过该数据探究性别薪酬差距、家庭结构对收入的影响,以及育儿责任对雇员收益的关联性。此外,数据集的时序属性(2001年)为横截面比较提供了基础,便于在控制其他社会经济学变量时,剖析特定欧洲区域的收入分配格局。
实际应用
从实际应用视角看,该数据集能为政策制定者与社会机构提供精准的收入画像。例如,劳动部门可据此评估不同家庭结构下雇员的购买力差异,从而优化最低工资标准或家庭福利的调整机制。国际组织或非政府组织亦可利用其分层特征,监测特定群体(如单亲父母或女性照料者)的经济脆弱性,并为设计针对性的职业培训或育儿支持方案提供数据支撑。
衍生相关工作
基于该数据集的结构特点,已衍生了若干值得关注的学术工作。例如,研究者利用其性别与家庭类型维度,构建了欧洲区域内的性别薪酬差距预测模型,或结合ILOSTAT中其他年份的数据,开展了收入不平等演变的纵向分析。此外,该数据还常被用作基准测试集,用于比较不同统计模型(如分层线性模型与随机森林)在稀疏时间序列与多分类变量场景下的预测性能,推动了劳动统计中异构数据处理方法的迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务