遇见数据集

electricsheepasia/asia-ilo-ear-emtg-sex-eco-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含24,547个观察值,覆盖27个亚洲国家,时间跨度为1996年至2025年,涉及1个指标,主题为收入和薪酬不平等。具体指标为按性别和经济活动划分的员工月收入基尼指数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过亚洲国家代码过滤,采用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集适用于表格分类、回归和时间序列预测任务,语言为英语,规模为10K到100K之间,许可证为cc-by-4.0。

This dataset contains 24,547 observations of income and pay inequality data across 27 Asia countries, spanning 1996–2025, covering 1 distinct indicator: Gini index of monthly earnings of employees by sex and economic activity. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asia ISO3 country codes, with harmonization based on ICLS definitions. It is suitable for tabular classification, regression, and time-series forecasting tasks, in English, with a size category of 10K to 100K, and licensed under cc-by-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtg-sex-eco-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)旗下的ILOSTAT数据库,该数据库是全球劳动统计领域的权威来源,汇集了来自各国劳动力调查、家庭收入调查、企业调查及行政记录的微观数据。数据经由ILOSTAT REST API直接抽取,并依据ILO统计部门制定的国际劳动统计学家会议(ICLS)标准进行统一清洗与协调。在提取过程中,数据被限定为亚洲地区ISO3国家代码所对应的观测值,最终整合为包含24,547条记录、覆盖27个亚洲国家、时间跨度从1996年至2025年的结构化表格数据。每个观测值都附有详细的来源标记,确保数据的可追溯性与透明度。
使用方法
该数据集以Hugging Face Datasets格式封装,用户可通过`load_dataset()`函数一键加载至Python环境,并利用Pandas等库进行深入分析。基础用法包括将数据转换为DataFrame格式,并支持按国家代码(如`ref_area`)、指标(如`EAR_EMTG_SEX_ECO_NB`)或时间维度进行切片与筛选。例如,可通过条件过滤提取某一国家的所有观测值,或按时间排序绘制特定指标的变化趋势。对于跨国家比较,可利用透视表功能将数据重塑为国家×年份的矩阵形式。数据集中所有列均配有清晰的标签与示例值,便于用户快速理解字段含义并进行后续建模或可视化分析。
背景与挑战
背景概述
收入不平等是发展经济学与社会政策研究的核心议题,基尼系数作为衡量收入分配差距的经典指标,长期受到国际组织与学术界的密切关注。在此背景下,国际劳工组织(ILO)依托其ILOSTAT数据库,整合全球劳动力调查与行政记录数据,构建了覆盖多个经济维度的劳动统计体系。该数据集由Electric Sheep Asia于2025年重新封装发布,聚焦亚洲地区27个国家1996至2025年间按性别和经济活动分类的月收入基尼系数,包含24,547条观测值,为区域收入不平等研究提供了标准化、机器可读的数据基础。该数据集的推出降低了跨国比较的数据获取门槛,推动了亚洲劳动力市场中性别工资差距与产业结构对收入分配影响等问题的量化分析。
当前挑战
该数据集所解决的领域核心挑战在于,亚洲各国收入分配数据长期存在统计口径不一、时间序列断裂以及性别细分不足等问题,限制了区域不平等动态的精确刻画。数据集构建过程中面临多重困难:各国原始调查数据来自劳动力调查、家庭收入调查等异构来源,ILO需依据国际劳动统计学家会议定义进行统一清洗与标准化;部分国家在特定年份存在数据缺失或观测状态为“序列断裂”的情况,影响了面板数据的连续性;此外,性别类别虽包含四个细分值,但经济活动的分类字段仍有非标准编码注释,需研究者谨慎处理。这些挑战使得跨国产出可比性与长期趋势推断成为应用中的关键难点。
常用场景
经典使用场景
该数据集汇聚了1996年至2025年间亚洲27个国家的月收入基尼系数,按性别与经济活动分类,共计24,547条观测记录。在劳动经济学与收入不平等研究领域,它最经典的使用场景是作为面板数据来源,用于跨国家、跨时间的收入差距比较分析。研究者常利用该数据集构建固定效应或随机效应模型,以探究性别收入差异在不同经济发展阶段亚洲国家中的演变规律,或考察经济结构转型对劳动报酬分配格局的长期影响。
解决学术问题
该数据集直接回应了发展经济学中关于亚洲国家收入不平等趋势的量化评估难题。通过提供标准化、可比较的基尼系数序列,它有效解决了原有各国统计口径不一、时间跨度有限导致的跨国分析障碍。学者可据此验证库兹涅茨假说在亚洲地区的适用性,量化对外开放、产业升级与劳动市场制度对收入分配的影响弹性。其性别维度的细分数据更支撑了女性劳动参与率与薪酬平等问题的因果推断研究,为政策评估提供了坚实的数据基础。
实际应用
在实际应用层面,该数据集为国际劳工组织(ILO)与各国劳动部门提供了动态监测劳动报酬分配公平性的工具。数据分析师与政策制定者可利用其时间序列特征,定期生成亚洲区域收入不平等报告,识别出哪些国家或经济部门的基尼系数出现异常波动。在社会保障与劳动政策设计场景中,该数据被用于模拟最低工资调整、税收政策变革对整体收入分配格局的可能影响,从而辅助决策者制定更具包容性的经济发展策略。
数据集最近研究
最新研究方向
在全球劳工权益与收入分配议题持续升温的背景下,该数据集聚焦于亚洲27国1996至2025年间按性别和经济活动划分的月收入基尼系数,为收入不平等研究提供了高分辨率的时间序列素材。前沿方向主要围绕性别薪酬鸿沟的跨产业异质性分析,借助长面板数据揭示经济发展阶段、产业结构转型与收入分配格局之间的非线性关联。结合国际劳工组织推动的体面劳动议程与可持续发展目标,该数据集能够支撑学者们量化评估政策干预、贸易开放及自动化进程对不同性别群体收入分布的动态冲击,进而为区域包容性增长战略的制定提供实证锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务