遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-dsb-nb-median-hourly-earnings-of-employees-by-sex-and-dis

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和残疾状况分类的员工每小时收入中位数(本地货币)| 亚洲(ILOSTAT),由Electric Sheep Asia重新打包发布。它包含542个观测值,覆盖15个亚洲国家(包括柬埔寨、亚美尼亚、印度尼西亚等),时间跨度为1997年至2024年。数据集的核心指标是员工每小时收入中位数,按性别和残疾状况分类(本地货币),指标代码为EAR_EHRM_SEX_DSB_NB。数据来源于国际劳工组织(ILOSTAT)的REST API,经过ILO根据国际劳工统计学家会议定义进行标准化处理。数据集采用表格格式,包含15列,如国家代码(ref_area)、国家名称(ref_area.label)、数据来源(source.label)、指标代码(indicator)、指标标签(indicator.label)、性别分类(sex)、时间(time)、观测值(obs_value)等,支持按性别(总计、男性、女性等)和残疾状况进行分组。数据集适用于表格分类、回归和时间序列预测等机器学习任务,并遵循CC-BY-4.0许可证。数据质量方面,注意为年度频率,ILO选择最佳来源,且分组列仅在指标发布细分数据时非空。使用示例包括加载数据、按国家筛选、绘制时间序列图等。

This dataset is titled Median hourly earnings of employees by sex and disability status (local currency) | Asia (ILOSTAT) and is repackaged by Electric Sheep Asia. It contains 542 observations across 15 Asian countries (including Cambodia, Armenia, Indonesia, etc.), spanning the years 1997 to 2024. The core indicator is Median hourly earnings of employees by sex and disability status (local currency) with the code EAR_EHRM_SEX_DSB_NB. The data is sourced from the International Labour Organization (ILO) ILOSTAT REST API, harmonized by ILO based on International Conference of Labour Statisticians definitions. The dataset is in tabular format with 15 columns, such as country code (ref_area), country name (ref_area.label), data source (source.label), indicator code (indicator), indicator label (indicator.label), sex disaggregation (sex), time (year), observed value (obs_value), etc., supporting disaggregation by sex (total, male, female, etc.) and disability status. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, and is licensed under CC-BY-4.0. Data quality notes include annual frequency, ILO-selected best source for duplicates, and disaggregation columns being non-null only when breakdowns are published. Usage examples include loading the dataset, filtering by country, plotting time-series, and pivoting to matrices.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-dsb-nb-median-hourly-earnings-of-employees-by-sex-and-dis 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接采集指标EAR_EHRM_SEX_DSB_NB(按性别和残疾状况划分的雇员小时收入中位数)的原始数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据随后被筛选至亚洲地区的ISO三位字母国家代码,最终汇集了15个亚洲国家自1997年至2024年间的542条观测记录。数据构建过程中,ILOSTAT对来自劳动力调查、家庭收入调查等多种来源的微观数据进行了协调统一,并在source.label字段中标注了每项数据的原始出处,确保了数据的可追溯性与权威性。此外,该数据集由Electric Sheep Asia团队重新打包为Parquet格式,以便于机器学习领域的直接调用。
特点
数据集的核心特征在于其细粒度的分类维度,不仅提供了按性别(SEX_T、SEX_M、SEX_F、SEX_O)的细分,还纳入了残疾状况(如DSB_STATUS_TOTAL)这一重要的社会人口学变量,为分析劳动力市场中不同群体的收入差异提供了宝贵素材。数据覆盖跨度长达近三十年,时间序列完整,且每年以频率记录,便于进行纵向趋势分析。尽管观测总数不足千条,但其聚焦于亚洲地区,涵盖了从柬埔寨(107条)到阿富汗(8条)等经济发展水平各异的国家,地理代表性较强。此外,每个观测值均附带了观察状态标志(obs_status)、备注注释(note_indicator)等元数据,有助于用户对数据质量进行审慎评估。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数便捷加载该数据集,将其转化为Pandas DataFrame进行后续分析。具体而言,可直接调用`load_dataset("electricsheepasia/asia-ilo-ear-ehrm-sex-dsb-nb-median-hourly-earnings-of-employees-by-sex-and-dis")`获取训练集。针对国家维度的筛选,例如提取印度尼西亚(IDN)的数据,只需对ref_area列进行过滤。对于时间序列分析,可依据indicator代码对特定指标进行排序并绘图。同时,用户也能利用pivot_table方法将数据重塑为国家×时间的矩阵格式,便于开展跨国比较和面板数据分析。该数据集设计精良,开箱即用,极大降低了劳动经济学研究中的数据处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT于2024年整理发布,并由Electric Sheep Asia重新打包为机器学习就绪格式。数据覆盖1997年至2024年间亚洲15个国家的542条观测记录,核心研究问题聚焦于按性别与残疾状态划分的员工小时收入中位数,旨在揭示劳动力市场中不同群体的薪酬差异。作为ILO推动体面劳动与可持续发展目标(SDG)的重要数据基础,该数据集为劳动经济学、社会政策与公平薪酬研究提供了关键的量化依据,尤其填补了亚洲地区关于残疾人群收入数据的系统性空白,对推动包容性经济增长具有显著影响力。
当前挑战
该数据集面临的挑战主要体现在两个层面。首先,在所解决的领域问题方面,劳动力市场中的收入不平等问题长期存在,而传统数据往往缺乏按性别与残疾状态交叉细分的粒度,难以精准刻画弱势群体的薪酬困境,该数据集恰恰弥补了此分析维度缺失。其次,在构建过程中,数据源自各国劳动力调查、家庭收入调查等多源异构渠道,ILOSTAT虽采用统一统计标准进行协调,但仍面临不同调查方案、时间跨度与质量标记带来的数据可比性挑战;此外,部分国家观测年份稀疏(如阿富汗仅8条记录),且存在序列中断等标记,可能影响时间序列分析的稳健性。
常用场景
经典使用场景
该数据集汇集了亚洲15个国家1997年至2024年间雇员按性别与残疾状况划分的时薪中位数数据,共计542条观测记录。在劳动经济学与不平等研究中,它被广泛用于分析性别与残疾状态对薪酬水平的交叉影响。研究者常借助该数据集构建跨国家的面板数据模型,考察不同政策环境与文化背景下,残疾雇员与非残疾雇员、男性与女性之间的薪酬差距随时间演变的动态趋势。
衍生相关工作
该数据集衍生了一系列聚焦亚洲劳动市场包容性测度的研究范式。一些经典工作将其与ILOSTAT的其他指标(如就业率、失业时长)耦合,构建了衡量残疾劳工社会经济福祉的多维指数模型。另有一类工作引入了机器学习方法,通过时序预测算法来预警特定国家因经济周期波动可能引发的残疾群体薪酬恶化风险,为开发实时劳动市场监测仪表盘提供了方法论基础,推动了计算社会科学与劳动政策的深度融合。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别与残疾状态划分的雇员中位数小时收入,其最新研究方向紧密关联全球包容性经济增长与体面劳动议程。在国际劳工组织推动下,该数据为量化分析残疾群体在劳动力市场中的收入差异提供了关键依据,尤其在后疫情时代,随着各国加强社会保障与就业平等政策,此类精细化时序数据成为评估政策效果、揭示结构性歧视的核心工具。结合联合国可持续发展目标(SDG 8.5),研究者可借此追踪亚洲国家在缩小收入性别鸿沟及残疾人口就业质量方面的真实进展,为制定证据驱动的劳动力市场干预措施奠定坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务