遇见数据集

electricsheepeurope/europe-ilo-lap-2lid-qtl-rt-labour-income-distribution-by-decile-ilo-modelled

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家从2004年至2025年的劳动收入按十分位数分布的数据,基于国际劳工组织(ILO)的模型估计(截至2025年9月)。数据集共有8540个观测值,涵盖1个主要指标(代码为LAP_2LID_QTL_RT),该指标表示劳动收入在十分位组中的百分比分布。数据来源于ILOSTAT数据库,通过REST API获取,并经过标准化处理,使用国际劳工统计学家会议(ICLS)定义进行协调。数据集以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、指标标签、分类变量(如十分位组)、观测年份、观测值、观测状态等列。数据为年度频率,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Europe重新打包发布,采用CC-BY-4.0许可证。

This dataset contains labour income distribution by decile data for 39 European countries from 2004 to 2025, based on International Labour Organization (ILO) modelled estimates as of September 2025. It includes 8,540 observations covering one distinct indicator (code LAP_2LID_QTL_RT), which represents the percentage distribution of labour income across decile groups. The data is sourced from the ILOSTAT database, retrieved via REST API, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset is structured in tabular format with columns such as country code, country name, data source, indicator code, indicator label, classification variables (e.g., decile groups), observation year, observed value, and observation status. It is annual frequency data and suitable for tasks like tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Europe and released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-lap-2lid-qtl-rt-labour-income-distribution-by-decile-ilo-modelled 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦欧洲地区劳动收入分配的基尼系数与分位数指标。构建过程中,通过ILOSTAT的REST API接口(地址为rplumber.ilo.org)直接拉取原始数据,并依据ISO 3166-1 alpha-3标准筛选出39个欧洲国家的观测记录。所有数据均采用国际劳工统计学家会议(ICLS)定义进行统一化处理,同时保留原始调查来源的标识字段以增强可追溯性。数据集共收录8540条观测,覆盖2004至2025年间年度频率的劳动收入分配分位数数据,经Electric Sheep Europe重新整理后以Parquet格式封装,确保机器学习场景下的高效加载。
特点
本数据集的核心特点在于其多维度的结构设计,包含国家代码、指标编码、分类变量(如收入分位数)、观测年份及数值等关键字段。其中分类变量支持按收入十分位、性别或教育水平进行细分,但仅在指标发布对应分组时才填充非空值。数据质量方面,当同一国家同年份存在多个来源时,优先采用ILO指定的最佳来源;状态标记字段则明确标识观测值是否基于模型外推等处理。此外,数据集覆盖了从2004年至2025年长达22年的年度序列,为时间序列分析与收入不平等趋势研究提供了扎实的纵向基础。
使用方法
借助HuggingFace Datasets库,用户可通过load_dataset()一行代码加载该数据,并利用to_pandas()方法快速转换为DataFrame格式以进行后续分析。使用时可按国家代码筛选特定经济体的子集,或按指标代码提取劳动收入分配分位数的完整时间序列。典型操作包括基于时间序列的绘图分析、构建国家-年份透视矩阵以比较各国收入分配格局的演变。数据集同时提供了观测状态标记与来源信息,便于研究者根据数据可靠性进行质量过滤,适用于劳动经济学、社会不平等及欧洲区域发展等领域的统计建模与实证研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,依托其核心统计数据库ILOSTAT,聚焦欧洲39个国家2004至2025年间劳动收入分配的分位数分布情况。ILO作为全球劳动统计的权威机构,通过整合各国劳动力调查与行政记录,采用国际劳工统计学家会议(ICLS)标准对原始微观数据进行协调,生成了包含8540条观测值的标准化面板数据。该数据集的核心研究问题在于量化欧洲各国劳动收入不平等程度及其动态演变,为劳动经济学、社会政策评估及可持续发展目标(SDGs)中体面工作指标的监测提供了关键数据支撑。其精细的分位层级结构使得研究者能够深入剖析收入分配底层至顶层的结构性变化,对理解欧洲区域经济融合与社会公正议题产生了深远影响。
当前挑战
该数据集所应对的领域挑战在于劳动收入分配数据的跨国可比性与长期一致性问题。不同国家基于各自调查工具与统计口径生成的原始数据存在系统性偏差,ILO需要通过建模估计手段填补缺失值与调和定义差异,但模型外推法(obs_status为'M')引入的估算误差可能削弱结果的稳健性。数据构建过程中面临的核心挑战包括:多源数据整合时优先采用ILO遴选的'最佳来源',这一筛选机制虽旨在提升质量,却可能隐没次优来源中包含的局部信息;同时,部分指标仅发布年度频次,季度或月度的高频波动未能纳入,限制了实时预警能力;此外,分类变量(如性别、教育水平)仅在特定分项中非空,造成维度不完整的稀疏矩阵,增加了多变量联合分析的复杂度。
常用场景
经典使用场景
该数据集的核心应用场景在于对欧洲各国劳动收入分配格局进行多维度量化剖析。研究人员可借助其覆盖39个国家、横跨2004至2025年的分位数数据,绘制劳动收入在各十分位组间的分配曲线,从而精准刻画收入不平等程度及其动态演变轨迹。通过时间序列视角,学者能够系统追踪各国劳动收入份额的长期趋势,并比较不同国家在特定时段内的分配结构异同,为理解欧洲劳动力市场的收入分配机制提供坚实的数据基础。
实际应用
在实际应用层面,该数据集为国际组织、各国政策制定机构及社会研究智库提供了关键决策依据。国际劳工组织可据此监测成员国在可持续发展目标(SDG)下关于体面工作和经济增长指标的进展;欧盟委员会可利用分位数数据评估社会包容性政策的实施效果,并识别面临收入极化风险的脆弱群体。此外,非政府组织在撰写国家收入不平等报告时,可借该数据集进行跨国横向比较,从而提出更具针对性的劳动力市场改革建议,促进社会公平与包容性增长。
衍生相关工作
该数据集衍生出一系列具有重要影响力的研究工作。基于其结构化的面板数据,学者们已构建了欧洲劳动收入集中度指数,并开发了预测不同经济情景下收入分配变化的动态随机一般均衡模型。部分研究将其与宏观面板数据结合,考察了税收累进性、教育回报率与自动化冲击对劳动收入份额的异质性影响。此外,该数据集还催生了一批可视化分析平台,使得公众能够直观了解各国收入分配的时间演变,促进了学术成果向公共知识产品的有效转化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务