遇见数据集

electricsheepasia/asia-ilo-ear-xtlp-sex-rt-low-pay-rate-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲31个国家从1990年至2025年关于收入与薪酬不平等的1,010个观察值,具体指标为按性别划分的低薪酬率(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,涵盖了按性别(总计、男性、女性)分类的年度统计值,包括国家代码、国家名称、数据来源、观测年份、观测值及相关注释信息。数据集经过Electric Sheep Asia重新打包,以标准化模式提供,便于机器学习使用。

This dataset contains 1,010 observations of income and pay inequality data across 31 Asia countries, spanning 1990 to 2025, covering one distinct indicator: Low pay rate by sex (%). The data is sourced from the International Labour Organizations ILOSTAT database, providing annual statistics disaggregated by sex (total, male, female), including country codes, country names, data sources, observation years, observed values, and related notes. The dataset is repackaged by Electric Sheep Asia with a normalized schema for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-xtlp-sex-rt-low-pay-rate-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于亚洲地区按性别划分的低薪率指标。通过调用ILOSTAT的REST API接口,直接获取原始指标代码为EAR_XTLP_SEX_RT的观测数据,并依据亚洲ISO 3166-1 alpha-3国家代码进行地理范围过滤。数据在ILOSTAT内部经由国际劳工统计学家会议(ICLS)定义框架进行原始调查微观数据的协调统一,数据来源在source.label列中予以标注,以保证可追溯性。最终由Electric Sheep Asia团队将其重新打包为适用于机器学习工作流的标准化格式。
特点
本数据集涵盖31个亚洲国家,时间跨度从1990年至2025年,共计1010条观测记录。其核心特征在于提供了单一但关键的劳动力市场不平等指标——按性别分列的低薪率百分比,并通过sex维度(总、男、女)进行精细解耦。每条记录包含ref_area、source、indicator、time、obs_value等结构化字段,同时附有观测状态标志和注释列以说明数据质量变更,如序列中断与方法修订。数据以年度频率呈现,并采用ILO选定的‘最佳来源’以解决同一国家同年份多数据源冲突。
使用方法
研究者可借助HuggingFace Datasets库的load_dataset函数直接加载该数据集,并将其转换为Pandas DataFrame以便进行后续分析。典型应用场景包括筛选特定国家的时序数据进行可视化,或对低薪率指标按时间与国家进行透视以构建国家×年份矩阵,从而探究区域内收入不平等的变化趋势。数据集遵循CC-BY-4.0许可协议,使用时应同时引用ILO的原始数据和Electric Sheep Asia的再打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT数据库于2025年整理发布,并经Electric Sheep Asia重新封装,专注于亚洲31个国家1990至2025年间低薪率按性别分层的统计数据。作为全球劳动统计领域的权威来源,ILOSTAT通过整合劳动力调查、家庭收入调查等多源数据,为衡量收入与薪酬不平等提供了标准化工具。该数据集的核心研究问题在于揭示亚洲地区不同性别劳动者在低薪就业中的分布差异,其1010条观测值覆盖了韩国、日本、印度尼西亚等国家,为政策制定者与研究者提供了纵向时间序列数据,以评估性别薪酬差距的演变趋势及劳动市场结构性不平等问题。自发布以来,该数据集因其在区域劳动经济学、性别平等及可持续发展目标(SDG)监测中的重要作用,成为亚洲劳动力市场分析的关键参考资源。
当前挑战
该数据集的领域挑战主要在于解决亚洲国家间劳动统计标准不统一、数据可比性不足的问题,例如各国对‘低薪’的定义差异(基于收入中位数比例或绝对阈值)可能导致跨国比较时的偏差。构建过程中面临的核心挑战包括:数据源多元且质量参差,涉及劳动力调查、行政记录等不同口径,需依赖ILO的‘最佳来源’选择机制进行调和;历史数据缺失严重,如阿富汗、老挝等国家仅有零星年份的观测值,制约了完整时间序列的构建;性别分类维度的稀疏性导致部分国家无法提供按性别分列的连续数据,例如印度仅覆盖2018至2025年且行数有限,削弱了性别差异分析的稳健性。此外,数据标注中的‘断点’标记(如方法论修订)要求用户谨慎处理统计口径变更带来的序列不连续性。
常用场景
经典使用场景
在劳动经济学与性别不平等研究中,该数据集常被用作衡量亚洲各国低薪率及其性别差异的核心数据源。研究者可借助其覆盖31国、跨越35年的面板数据,构建固定效应或随机效应模型,分析经济周期、产业结构变迁与最低工资政策对低薪率动态演化的影响。其按性别分层的观测值,使得性别工资差距的时间序列比较成为可能,为探究女性过度集中于低薪职业的社会结构性成因提供了扎实的实证基础。
实际应用
在实际政策制定领域,该数据集为国际劳工组织、各国劳动部门及非政府组织提供了监测与评估‘体面工作’目标的量化仪表盘。借助其跨年度、跨国家的可比指标,政策分析师可以精准锁定低薪率持续高企的国家与行业,评估性别平等政策(如同工同酬立法、最低工资上调)的实施效果。它亦被广泛应用于开发面向可持续发展目标8的国别进度仪表板,赋能基于证据的社会治理决策。
衍生相关工作
依托该数据集,衍生出了一系列以跨国面板计量方法为核心的经典工作。研究者基于其时序结构,使用差分广义矩估计或系统广义矩估计方法,检验了贸易开放度、外商直接投资与女性低薪率之间的非线性关系。另有学者将其与世界银行的企业调查数据或教育统计数据进行纵向链接,构建了分析人力资本积累、产业结构升级与低薪陷阱逃离概率之间的因果推断框架,为劳动经济学中的就业质量研究注入了崭新的亚洲视野。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务