遇见数据集

electricsheepasia/asia-ilo-ear-xfls-noc-rt-female-share-of-low-pay-earners

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲29个国家从1995年至2025年的收入和薪酬不平等数据,涵盖268个观测值和1个独特指标。具体来说,它专注于低收入劳动者中女性占比(%)这一指标,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集包括国家代码、国家名称、数据来源、指标代码、指标标签、观测年份、观测值、观测状态和相关注释等字段,适用于表格分类、回归和时间序列预测任务。数据经过ILO的标准化处理,以确保国际可比性,并标注了数据质量和注意事项,如年度频率、最佳来源选择等。

This dataset contains 268 observations of Income and pay inequality data across 29 Asia countries, spanning 1995–2025, covering 1 distinct indicators. Specifically, it focuses on the Female share of low pay earners (%) indicator, sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asia countries. The dataset includes fields such as country codes, country names, data sources, indicator codes, indicator labels, observation years, observed values, observation statuses, and related notes, making it suitable for tabular classification, regression, and time-series forecasting tasks. The data is harmonized by ILO for international comparability, with notes on data quality and caveats, such as annual frequency and best-source selection.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-xfls-noc-rt-female-share-of-low-pay-earners 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API自动抓取指标EAR_XFLS_NOC_RT的数据,并依据亚洲ISO3国家代码进行筛选与重构。数据整合了29个亚洲国家在1995至2025年间的观测记录,共计268条。ILOSTAT对各国劳动力调查、家庭收支调查及行政记录等原始微观数据,按照国际劳工统计学家大会(ICLS)定义进行标准化处理,并以最佳来源原则选取同一国家与年份的优先数据源,确保数据的连贯性与可比性。最终由Electric Sheep Asia以统一架构封装为HuggingFace数据集,便于机器学习研究直接调用。
特点
该数据集聚焦亚洲地区低收入劳动者中女性占比这一关键指标,覆盖29个亚洲国家长达三十年(1995–2025)的时间序列,共268条高质量观测值。每个观测记录包含国家代码、数据来源、指标定义、观测年份及数值、状态标记与注释说明等完整元信息,支持多维度筛选与追溯。数据采用年度频率,并对指标定义变更、方法修订等异常状态加以标注,保障了分析时的透明性与可靠性。此外,所有数据均遵循CC-BY 4.0开放许可协议,具有极高的可复用性与学术引用价值。
使用方法
使用者可通过HuggingFace Datasets库以一行代码直接加载整个数据集,并转换为Pandas DataFrame进行后续分析。典型应用包括:按国家代码筛选特定国家的时间序列数据;对单一指标按年份排序后绘制趋势图,观察女性低收入占比的演变;以及构建以年份为行、国家为列的透视矩阵,便于横向比较区域差异。数据集中所有列均采用标准化命名与类型,字段含义清晰,支持即开即用的探索性数据分析与时间序列建模任务,极大降低了劳动经济学研究的预处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)创制,经Electric Sheep Asia于2026年重新封装并发布在HuggingFace平台,聚焦亚洲29个国家自1995年至2025年间低薪劳动者中女性占比的变动趋势。作为ILOSTAT数据库的衍生品,其核心旨在量化亚洲地区劳动收入性别不平等的长期演化,填补了区域层面微观数据整合的空白。通过对268条观测记录的协同分析,研究者得以追溯女性在低薪群体中的结构性弱势,从而评估劳动政策与经济发展对性别收入鸿沟的矫正效应。该数据集为劳动经济学、发展社会学及公共政策研究提供了标准化的跨时空比较基础,尤其对亚洲新兴经济体中的性别平等议题具有重要启示。
当前挑战
该数据集所解决的领域核心挑战在于,亚洲多国女性从事非正规就业的比例显著高于男性,且低薪群体中女性过度集中的现象长期被碎片化的统计体系所遮蔽。构建过程中遭遇的障碍主要包括:各国劳动调查在方法论、分类标准与时间跨度上的不一致性,ILO虽通过ICLS定义进行协调,但源数据标注的断裂(如‘Break in series’标记)仍威胁时序连续性;部分国家样本量极为有限(如东帝汶仅5条记录),导致区域可比性受限;此外,数据仅包含年度频率,缺失季度或月度变动的细微洞察,对于捕捉新冠疫情期间劳动市场的剧烈波动而言存在时间颗粒度不足的局限性。
常用场景
经典使用场景
该数据集聚焦于亚洲地区女性低薪工作者占比的纵向追踪,涵盖1995至2025年间29个国家的268条观测记录。其最经典的运用在于构建面板数据模型,量化分析亚洲各国女性在低薪阶层中的结构性分布,并与劳动参与率、教育水平、产业结构等社会经济指标进行关联研究。研究者常借助此数据开展性别工资差异的跨区域比较分析,识别各国在缩小性别收入鸿沟方面的政策成效与阶段性特征,为劳动经济学中关于性别不平等议题提供实证基础。
解决学术问题
该数据集有效填补了亚洲区域层面关于性别薪酬不平等长期面板数据的空白,解决了传统研究中因数据匮乏难以开展跨国产出比较与历时性分析的困境。学术上,它支撑了关于女性低薪劳动者结构性成因的实证探讨,包括劳动力市场分割理论、性别歧视在低薪岗位中的固化效应,以及全球化与产业结构转型对女性就业质量的影响。数据集的发布显著推动了亚洲国家间性别平等政策评估的定量研究,为验证最低工资制度、社会保险覆盖等干预措施的实际效果提供了关键数据支撑。
衍生相关工作
该数据集衍生出的经典工作主要集中在对ILOSTAT数据的再包装与多源融合分析。研究者已将其与亚洲国家其他社会经济指标进行联合建模,如将女性低薪占比与教育获得指数、服务业就业比例构建多变量回归框架,探讨经济转型对性别收入的影响。此外,基于该时序数据的时间序列预测模型亦被开发用于预判至2030年联合国可持续发展目标中性别平等指标的达标进度。部分工作进一步细化了按年龄组、城乡、教育程度的分层分析,揭示了亚洲内部女性低薪问题的异质性特征。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务