遇见数据集

electricsheepasia/asia-ilo-ear-emtg-sex-geo-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含2,304个观测值,覆盖25个亚洲国家(如印度尼西亚、柬埔寨、菲律宾等),时间跨度为1996年至2025年。数据集专注于收入与薪酬不平等主题,具体指标为按性别和城乡地区划分的员工月收入基尼指数(EAR_EMTG_SEX_GEO_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家,涵盖了国家代码、来源信息、指标分类、性别维度(总计、男性、女性等)、观测年份、基尼指数值、数据状态标志等列。数据集适用于表格分类、回归和时间序列预测任务,由Electric Sheep Asia重新打包以提供统一的机器学习就绪格式,许可证为cc-by-4.0。

This dataset contains 2,304 observations across 25 Asia countries (e.g., Indonesia, Cambodia, Philippines) spanning 1996 to 2025. It focuses on the topic of income and pay inequality, with the specific indicator Gini index of monthly earnings of employees by sex and rural / urban areas (EAR_EMTG_SEX_GEO_NB). Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asian countries, including columns such as country code, source information, indicator classification, sex dimension (total, male, female, etc.), observation year, Gini index value, and data status flags. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, repackaged by Electric Sheep Asia to provide a unified ML-ready format under the cc-by-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtg-sex-geo-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接提取指标代码为EAR_EMTG_SEX_GEO_NB的数据,并依据亚洲ISO3国家代码进行过滤筛选。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一整合,并在source.label字段中标注数据来源以确保可追溯性。数据集由Electric Sheep Asia重新封装,以结构化表格形式呈现,总计2304条观测记录,覆盖25个亚洲国家,时间跨度从1996年至2025年,聚焦于收入与薪酬不平等主题。
特点
本数据集的核心特点在于其高度的结构化和多元维度设计。数据包含ref_area(国家代码)、sex(性别分类,分为总计、男性、女性、其他)、time(观测年份)以及obs_value(基尼指数值)等关键字段,支持按性别和城乡区域进行细分分析。所有观测值均附有obs_status状态标记(如序列中断等),并提供了来源说明与注释信息,有助于评估数据质量。此外,数据以年度频率发布,并通过ILO选定的“最佳来源”进行融合,确保了跨国家和跨时间维度上的可比性与一致性。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,使用`load_dataset("electricsheepasia/asia-ilo-ear-emtg-sex-geo-nb-gini-index-of-monthly-earnings-of-employees-by-sex")`命令即可获取训练集,并将其转换为pandas DataFrame进行后续分析。针对特定国家的子集筛选,可通过条件过滤如`df[df["ref_area"] == "IDN"]`实现。对于时间序列分析,建议按indicator和time字段排序后绘制obs_value的变化趋势。同时,支持利用pivot_table将数据重塑为国家×年份的矩阵形式,便于横向比较与回归建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT于2025年发布,并由Electric Sheep Asia重新封装整理,聚焦于亚洲25个国家1996至2025年间基于性别与城乡区域的月收入基尼指数(共计2304条观测)。基尼指数作为度量收入分配不平等程度的权威指标,在劳动经济学与发展经济学领域具有基石地位,而亚洲作为全球经济增长最活跃但收入差距问题突出的区域,其细粒度、跨性别与空间维度的收入不平等数据尤为稀缺。该数据集填补了这一空白,为研究亚洲内部劳动力市场中性别红利与地域发展不均衡的交互效应提供了标准化、可复现的时序数据基础,对推动区域不平等政策评估与跨国比较研究具有重要学术价值。
当前挑战
在领域问题层面,该数据集致力于解决劳动经济学中收入不平等测度的空间与性别维度割裂难题:传统宏观经济数据通常仅提供国家层面的总体基尼指数,无法揭示女性与农村劳动力面临的系统性收入劣势,而该数据集通过维度分解(性别与城乡)使研究者得以量化结构性歧视与环境差异的叠加影响。在构建过程中,核心挑战在于跨国数据源的口径协调与质量管控——ILOSTAT需整合各国不同时期、不同统计方法(如劳动力调查与行政记录)的微观数据,并在保留源数据标记(如source.label与obs_status)的同时统一至ILO定义的标准框架;此外,年度频率与部分国家存在较长缺失窗口(如阿富汗2001年前后)导致时序不连续,需依赖内置的断点标志(如“Break in series”)与研究者的异质性处理策略来规避分析偏误。
常用场景
经典使用场景
在劳工经济学与收入分配研究领域,该数据集常被用于测度亚洲国家内部性别间及城乡间的工资不平等程度。凭借其涵盖1996至2025年间25个亚洲国家的基尼系数观测值,研究者能够通过面板数据分析工资不平等的时间演化趋势,或借助多层级模型探究经济发展、劳动力市场制度与收入分化之间的复杂关联。该数据集尤其适合开展跨国比较研究,如剖析不同亚洲经济体在性别工资差距上的异质性模式,或是检验库兹涅茨曲线在亚洲语境下的适用性。
衍生相关工作
围绕该数据集已衍生出多项重要的学术贡献与工具创新。一方面,它被整合进国际劳工组织的ILOSTAT数据库中,成为全球劳动力市场监测平台的核心支柱,支撑了诸如《全球工资报告》等旗舰出版物的实证分析。另一方面,经济学者基于此数据构建了亚洲收入不平等动态面板模型,揭示了贸易开放、女性劳动参与率与基尼系数的非线性关系,相关成果发表于《世界发展》等顶级期刊。此外,数据科学社区也利用该数据集开发了可视化仪表板和预测算法,用于预判未来工资分布的变化趋势,推动了负责任数据分析在劳动经济领域的实践。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区雇员月收入基尼系数的性别与城乡差异,为劳动经济学不平等研究提供了跨越1996至2025年、覆盖25国的时序面板数据。在当前国际劳工组织(ILO)推动体面劳动与可持续发展目标(SDG)的背景下,该数据集成为剖析亚洲薪酬不平等动态演变的重要工具。前沿研究借助其高颗粒度的性别与地域分类,可深入探究城镇化进程中女性劳动参与率提升对收入分配的影响,以及后疫情时代劳动力市场结构性调整如何重塑基尼系数的区域格局。该资源的系统整合不仅填补了亚洲发展中国家收入不平等微观数据的缺口,更通过标准化的ILOSTAT方法论确保了跨国可比性,为实证分析、政策模拟与机器学习预测提供了可靠基石,有力支撑了亚太地区公平增长战略的量化评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务