遇见数据集

electricsheepeurope/europe-ilo-ged-pear-sex-hht-geo-nb-average-monthly-earnings-of-prime-age-employees-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格数据集,包含53个观察值,覆盖1个欧洲国家(波斯尼亚和黑塞哥维那),时间跨度为2001年,涵盖1个独特指标:平均每月收入,按性别、家庭类型和城乡地区划分(本地货币)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码。数据集提供了详细的列结构,包括国家代码、国家名称、来源信息、指标代码、性别分类(总计、男性、女性)、家庭类型分类、地区类型分类、观察年份、观察值、观察状态等。数据频率为年度,并包含数据质量说明,如使用ILO选择的“最佳来源”和分类列的非空条件。该数据集旨在用于表格分类、回归和时间序列预测等任务,支持研究人员和开发者快速加载和分析欧洲劳动收入数据。

This dataset is a tabular dataset containing 53 observations across 1 European country (Bosnia and Herzegovina), spanning the year 2001, and covering 1 distinct indicator: average monthly earnings of prime-age employees by sex, household type and rural/urban areas (in local currency). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via the REST API and filtered to European country codes. The dataset provides a detailed schema including country codes, country names, source information, indicator codes, sex disaggregation (total, male, female), household type classification, area type classification, observation year, observed values, observation status, and more. The data frequency is annual, with quality caveats such as the use of ILO-selected best source and non-null conditions for disaggregation columns. It is designed for tasks like tabular classification, regression, and time-series forecasting, enabling researchers and developers to quickly load and analyze European labor earnings data.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ged-pear-sex-hht-geo-nb-average-monthly-earnings-of-prime-age-employees-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,通过REST API从该数据库中提取了特定指标“GED_PEAR_SEX_HHT_GEO_NB”的观测数据,并利用欧洲国家ISO3代码进行了地理范围筛选。数据经过Electric Sheep Europe的二次封装与标准化处理,整合为可直接用于机器学习研究的结构化表格数据。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行统一协调,并在`source.label`列中清晰标注了数据来源,确保了溯源的可追索性。
特点
数据集共包含53条观测记录,覆盖单个欧洲国家(波斯尼亚和黑塞哥维那),时间跨度为2001年。其核心指标为“按性别、家庭类型及城乡划分的壮年雇员平均月收入”,并以地方货币单位呈现。数据还提供了性别(总、男、女)、家庭类型及地域类型等多个维度的细分信息,丰富了分析层次。尽管样本量有限,但每条记录均包含详细元数据,如观测状态标记(如可靠性标识)及来源说明,有助于用户评估数据质量。
使用方法
用户可通过HuggingFace Datasets库便捷地加载数据,使用`load_dataset()`函数即可将数据集转换为Pandas DataFrame格式,便于后续的探索性分析与建模。示例代码展示了如何按国家过滤数据、针对特定指标绘制时间序列图,以及利用透视表构建国家×年份的数值矩阵。该数据集适用于表格分类、回归分析及时间序列预测等任务,尤其适合需要结合性别与家庭结构等人口学变量研究欧洲劳动力市场收入差异的场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2001年创建,经Electric Sheep Europe重新打包并发布在HuggingFace平台。核心研究问题聚焦于欧洲地区主要劳动力(prime-age employees)的月均收入,并按照性别、家庭类型及城乡地域进行细致拆解,旨在揭示劳动力市场中不同社会群体间的经济差异。数据源自ILOSTAT这一全球劳动统计领域的权威数据库,其统计指标覆盖就业、工资、工作时间等关键维度,为劳动经济学、社会分层及公共政策研究提供了可复现的微观数据基础。尽管样本量仅有53条观测值,覆盖1个欧洲国家(波斯尼亚和黑塞哥维那),但其精细的分组结构(如SEX_T/M/F及HHT_AGGREGATE_TOTAL等分类)为小范围区域内的收入不平等研究开辟了独特窗口,尤其适用于检验转型经济体中的劳动力市场表现。
当前挑战
研究领域内,首要挑战在于如何利用有限观测值(n<1K)及单一年份(2001)数据,克服统计推断的弱稳健性与泛化能力不足,准确辨识性别、家庭类型及城乡维度对收入的实际影响,从而为更广泛的欧洲收入不平等理论提供实证锚点。构建过程中,数据集遭遇多重技术困境:ILOSTAT原始数据源于多种调查类型(如劳动力调查、家庭收支调查),其方法论差异及ILO非公开的“最佳来源”选择标准,给数据一致性与可追溯性带来隐忧;此外,部分观测值被标记为“不可靠”(obs_status = 'U'),提示原始数据可能存在测量误差或采样偏差。分类变量(classif1和classif2)仅在特定指标出现时非空,导致高维拆解与缺失模式复杂化,增加了模型设计与结果解释的难度。
常用场景
经典使用场景
该数据集围绕欧洲地区壮年雇员的平均月收入,提供了按性别、家庭类型及城乡区域细致划分的面板数据。在劳动经济学与政策评估领域,研究者常将其作为基准数据源,用于构建收入决定因素的回归模型,分析性别工资差距的演化特征,或考察家庭结构对个体劳动回报的影响。数据的时间跨度为2001年,尽管观测数量有限,但其所包含的细分维度使其适用于微观层面的比较研究,尤其适合开展针对单一国家(如波斯尼亚和黑塞哥维那)的横截面收入分析,为理解特定劳动力市场的结构性特征提供实证基础。
实际应用
在实际应用层面,该数据集主要服务于国际组织、政府智库及社会政策制定者。它可用于监测联合国可持续发展目标中关于体面工作的具体进展,评估某一国家或地区在缩小性别薪酬差距方面的政策成效。例如,通过分析不同家庭类型雇员收入的变化,政策制定者能够识别出最需要社会援助的群体,从而设计更具针对性的转移支付或就业支持计划。此外,数据中的城乡分类为评价城镇化过程中劳动力市场融合程度提供了量化依据,帮助决策者在区域发展政策中融入公平性考量。
衍生相关工作
围绕该数据集已衍生出若干具有影响力的经典工作。一方面,ILO基于此类数据定期发布《全球工资报告》,构建了跨国工资水平与收入分配的比较分析框架;另一方面,学者们利用该数据中的性别与家庭类型细分维度,开展了关于工资差距分解的计量研究,推广了Oaxaca-Blinder分解方法在劳动经济学中的应用。此外,该数据还常被整合进更大规模的劳动统计面板中,助力于训练预测区域收入趋势的机器学习模型,并为欧洲劳动力市场监测系统提供了标准化的时间序列输入。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务