遇见数据集

electricsheepafrica/africa-ilo-ear-ehra-sex-dsb-cur-nb-average-hourly-earnings-of-employees-by-sex-and-di

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲22个国家从2005年至2024年的员工平均小时收入数据,按性别和残疾状况及货币划分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,包含1,548个观测值,覆盖1个核心指标(EAR_EHRA_SEX_DSB_CUR_NB)。数据集结构包括国家代码、来源信息、指标代码、性别分类、时间年份、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据经过ILO的标准化处理,并包含数据质量说明,如年度频率和最佳来源选择。

This dataset contains average hourly earnings of employees in Africa, disaggregated by sex and disability status and currency, covering 22 African countries from 2005 to 2024. It includes 1,548 observations and one key indicator (EAR_EHRA_SEX_DSB_CUR_NB), sourced from the International Labour Organization (ILO) ILOSTAT database. The dataset features columns such as country codes, source information, indicator codes, sex classifications, time years, and observed values, and is suitable for tabular classification, regression, and time-series forecasting tasks. Data is harmonized by ILO with quality notes, including annual frequency and best-source selection.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehra-sex-dsb-cur-nb-average-hourly-earnings-of-employees-by-sex-and-di 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接抽取指标代码为EAR_EHRA_SEX_DSB_CUR_NB的观测数据。原始数据基于各国劳动力调查、家庭收入调查及行政记录等微观数据,经ILO依据国际劳工统计学家会议(ICLS)定义进行统一协调处理。数据集进一步筛选聚焦于非洲地区的22个国家,覆盖2005年至2024年间共1,548条观测记录。每条观测均包含国家、性别、残疾状况、货币类型及年份等多维度分类信息,并以观测值字段记录平均时薪数据。为了确保数据可追溯性,数据源被标注于source.label列中。
特点
本数据集的核心特色在于其精细的多维度分层结构,同时按性别(男性、女性、总计)和残疾状态(总计)对员工的平均时薪进行细分,揭示劳动力市场中不同群体的薪酬差异。数据集覆盖22个非洲国家,时间跨度长达二十年,为研究非洲地区薪酬趋势、性别平等及残疾包容性就业提供了宝贵的纵向视角。数据以年度频率呈现,并标注了观测状态(如不可靠、临时值)以提示数据质量。此外,除核心指标外,数据集还包含货币类型、数据来源等辅助分类字段,便于用户进行多角度交叉分析与政策评估。
使用方法
使用者可通过HuggingFace的datasets库以一行代码轻松加载数据:load_dataset('electricsheepafrica/africa-ilo-ear-ehra-sex-dsb-cur-nb-average-hourly-earnings-of-employees-by-sex-and-di')。加载后可将训练集转换为pandas DataFrame进行分析。常见操作包括按国家筛选(如df[df['ref_area'] == 'KEN'])、对特定指标绘制时序图(按time列排序后以obs_value绘图)、或利用pivot_table构建以年份为行、国家为列的透视矩阵。数据注释详细,每个字段均标注了描述与示例,便于二次开发与机器学习建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下ILOSTAT数据库创建,于2024年由Electric Sheep Africa整理并发布在HuggingFace平台。其核心研究问题聚焦于非洲22个国家2005至2024年间,按性别和残疾状况划分的雇员平均小时收入,旨在揭示劳动力市场中弱势群体的薪酬差异与不平等现象。作为全球劳动统计的权威来源,ILOSTAT的数据为政策制定者、经济学家及社会研究者提供了量化分析基础,尤其在评估可持续发展目标中体面工作与经济增长的进展方面具有重要影响力。该数据集覆盖1548条观测记录,通过统一的数据架构与元数据标准,为跨国家、跨时期的比较研究奠定了坚实基础。
当前挑战
该数据集所解决的领域挑战在于,非洲地区长期缺乏系统、可比且细颗粒度的劳动收入数据,导致性别与残疾相关的薪酬鸿沟难以被精确量化,进而阻碍了针对性政策干预与跨国基准对比。构建过程则面临多重数据整合障碍:原始数据源自各国劳动调查与行政记录,统计口径与采集频率不一,需要通过ILO的协调框架进行标准化处理,同时应对缺失值、异常波动及小样本国家代表性不足等问题。时序数据中存在的符号标记(如“不可靠”状态)进一步增加了清洗难度,要求使用者在分析时审慎甄别数据质量,以保障结论的稳健性与政策建议的可信度。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集凭借其覆盖22个非洲国家、横跨2005至2024年间的1548条观测记录,成为探究非洲大陆性别与残疾状况下员工平均小时工资差异的基石性资源。研究者可借助其按性别(男性、女性、总计)和残疾状态(总况、残疾、非残疾)细分的结构化面板数据,运用描述性统计、方差分析或面板数据回归模型,系统刻画不同群体在工资分配中的位置与变动趋势,揭示隐藏于宏观指标之下的结构性不平等。
衍生相关工作
围绕该数据集已衍生出若干具有影响力的经典工作。基于其的时间序列特性,研究者构建了非洲特定国家与地区的工资动态预测模型,用以预警工资不平等激增的风险。另一方面,有学者利用其分类变量(性别、残疾状态)与源数据标识(如劳动力调查类型)进行因果推断,评估不同统计口径对估计工资差异幅度的影响。此外,该数据集还作为输入被集成到多指标不平等综合指数中,与教育、健康等维度数据联动,产出多维贫困与包容性增长的复合测度成果,深化了对非洲劳动力市场结构转型的理解。
数据集最近研究
最新研究方向
在全球劳动力市场日益关注包容性与公平性的背景下,该数据集聚焦非洲地区雇员按性别与残疾状态划分的平均时薪差异,为研究劳动经济学中的薪酬歧视、性别平等及残障人士就业质量提供了关键量化基础。前沿研究方向包括利用时间序列建模分析2005至2024年间22个非洲国家的薪酬动态演进,结合多源调查数据评估国际劳工组织(ILO)统计标准在跨国比较中的适用性。这一数据资源顺应了联合国可持续发展目标(SDG 8和10)中对体面工作与减少不平等的监测需求,同时为政策制定者优化最低工资制度、设计针对性就业干预措施提供了实证支撑,推动了非洲大陆劳动力市场研究的精细化与数据驱动化转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务