electricsheepasia/asia-ilo-ged-pear-sex-hht-chl-nb-average-monthly-earnings-of-prime-age-employees-by
收藏数据链接:
官方服务:
资源简介:
该数据集包含亚洲16个国家从2000年至2025年的6,913个观测值,涵盖1个独特指标,即按性别、家庭类型和子女情况分类的壮年雇员的月平均收入(以当地货币计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过处理和过滤,专注于亚洲地区,用于表格分类、回归和时间序列预测等任务。数据集包括国家代码、指标值、性别、家庭类型、子女情况、年份等列,并提供了数据质量说明和使用示例。
This dataset contains 6,913 observations of Earnings data across 16 Asia countries, spanning from 2000 to 2025, covering 1 distinct indicator: Average monthly earnings of prime-age employees by sex, household type and presence of children (in local currency). It is sourced from the ILOSTAT database by the International Labour Organization (ILO), repackaged by Electric Sheep Asia for machine learning applications, and includes variables such as country codes, indicator values, sex, household type, presence of children, year, and data quality flags.
提供机构:
electricsheepasia搜集汇总
数据集介绍

构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT数据库抽取并经由Electric Sheep Asia二次封装而成。数据通过ILOSTAT REST API获取,筛选出亚洲地区的ISO国家代码,仅保留指标GED_PEAR_SEX_HHT_CHL_NB,即按性别、家庭类型及有无子女细分的壮年员工平均月收入(以当地货币计)。原始数据源自各国劳动力调查、家庭收支调查等官方统计,ILO依据国际劳工统计学家会议(ICLS)定义对微观数据进行标准化处理,并由Electric Sheep Asia集成为机器学习的就绪格式。
特点
数据集包含6,913条观测值,覆盖2000年至2025年间16个亚洲国家,囊括1个核心指标,并提供性别、家庭类型与子女状况等多个维度的分层信息。数据以年度频率发布,采用细粒度的ISO国家代码与指标编码,确保跨区域可比性。每个观测值均标注了数据来源和观测状态(如是否可靠),便于用户评估数据质量。通过‘最佳来源’机制处理同一国家同年份的多源冲突,且分层维度仅在指标发布相应细目时非空,兼顾了数据完整性。
使用方法
可通过HuggingFace Datasets库一键加载:`load_dataset("electricsheepasia/asia-ilo-ged-pear-sex-hht-chl-nb-average-monthly-earnings-of-prime-age-employees-by")`,数据集以Parquet格式存储,支持直接转换为Pandas DataFrame进行分析。用户可按国家代码过滤单国数据,对特定指标进行时间序列绘图,或将其透视为国家×年份的矩阵,便于面板数据分析与回归建模。该数据集适用于表格分类、回归及时间序列预测任务。
背景与挑战
背景概述
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,是全球劳动统计领域的权威数据源。由Electric Sheep Asia于2025年重新整理并发布,聚焦亚洲地区16个国家2000至2025年间黄金年龄雇员的平均月收入,依据性别、家庭类型及子女状况进行精细化分层。该数据集旨在填补亚洲区域劳动收入微观结构的系统性分析空白,为发展经济学、劳动社会学及跨国产出比较提供高颗粒度的时间序列数据。自发布以来,其高度结构化的格式与标准化元数据,显著降低了研究者整合多国收入数据的门槛,已成为探究亚洲劳动力市场分层与家庭经济福祉关系的重要基石。
当前挑战
该数据集面临的领域挑战主要在于劳动收入数据在跨国比较中常因统计口径、通货水平及调查方法差异而产生偏误,尤其是家庭结构与子女照料对女性收入惩罚效应的量化需要克服多维交互变量的混杂影响。构建过程中,挑战集中于从ILO原始API抽取并清洗非均匀频率的微观调查数据,需处理多个来源对同一国家-年份观测值的‘最优来源’仲裁,以及不同国家调查周期(如2000-2019年的柬埔寨与2020-2025年的巴基斯坦)导致的时序非对齐问题。此外,性别与家庭类型分类变量的稀疏编码(如SEX_O为其他)及部分观测值被标注‘不可靠’(obs_status=U),进一步增加了数据质量控制的复杂性。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中2000年至2025年间16个亚洲国家黄金年龄雇员的月均收入数据,并按性别、家庭类型及有无6岁以下子女等维度进行细致分层。研究人员常将其用于构建面板数据回归模型,以探究亚洲劳动市场中收入决定因素的结构性差异,例如利用固定效应模型分析性别收入差距随家庭责任分担的变化轨迹,或通过时间序列分解方法捕捉经济周期对特定人群收入的冲击效应。
实际应用
在国际发展组织和国家统计部门中,该数据集被广泛用于监测联合国可持续发展目标(SDGs)中的体面工作指标(目标8)及性别平等指标(目标5)。政策制定者可依据分解后的收入数据评估最低工资调整对不同家庭类型劳动者的覆盖效果,或识别哪类家庭(例如单亲或有幼儿的双职工家庭)在通胀周期中最需社会保障干预,从而设计更具靶向性的劳动市场补偿方案。
衍生相关工作
基于该数据,已有衍生研究将其与同期ILOSTAT的其他指标(如非正规就业率、工作时长)进行联合分析,构建了亚洲区域劳动市场综合福祉指数。部分工作进一步将收入分层结果与家庭消费调查数据对接,利用微模拟方法评估税收转移制度对家庭间收入再分配效应。此外,还涌现出利用该时间序列训练时序预测模型的尝试,旨在预判生育政策调整后未来五年的性别收入差距演化趋势。
以上内容由遇见数据集搜集并总结生成



