遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-nb-median-monthly-earnings-of-employees-by-sex-local

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的“按性别划分的员工月收入中位数(本地货币)”指标数据,专门针对亚洲地区。数据集涵盖27个亚洲国家,时间跨度为1996年至2025年,共包含831个观察值。数据以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、观察年份、观察值、观察状态等列。性别分类包括总计、男性、女性和其他。数据来源于ILOSTAT的REST API,并经过筛选和标准化处理,适用于表格分类、回归和时间序列预测等机器学习任务。数据集由Electric Sheep Asia重新打包发布,采用cc-by-4.0许可证。

This dataset contains the Median monthly earnings of employees by sex (local currency) indicator from the International Labour Organization (ILO) ILOSTAT database, specifically for Asia. It covers 27 Asian countries from 1996 to 2025, with 831 observations. The data is organized in tabular format, including columns such as country code, country name, data source, indicator code, indicator label, sex classification, observation year, observed value, and observation status. Sex classification includes total, male, female, and other. The data is sourced from the ILOSTAT REST API, filtered and normalized, and is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting. The dataset is repackaged by Electric Sheep Asia and released under the cc-by-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-nb-median-monthly-earnings-of-employees-by-sex-local 数据集图片
构建方式
本数据集基于国际劳工组织(ILO)的ILOSTAT数据库构建,通过其REST API直接获取指标编码为EAR_EMTM_SEX_NB的原始数据,并依据亚洲ISO 3166-1 alpha-3国家代码进行地理筛选。ILOSTAT采用国际劳动统计学家会议(ICLS)定义对各国劳动调查微观数据进行统一协调和处理,从而确保跨国家的数据可比性。数据集包含了来自27个亚洲国家的831条观测记录,时间跨度从1996年到2025年,覆盖了不同性别雇员的月收入中位数这一核心指标,而其数据来源的标识信息被保留在source.label列中以供溯源。
使用方法
用户可通过Hugging Face的datasets库快速加载数据,调用load_dataset函数即可获取训练集并转化为Pandas DataFrame进行后续分析。典型应用包括筛选特定国家数据进行地域性研究,或针对单一指标按时间排序以绘制时序变化趋势曲线。通过数据透视表操作,可便捷地将数据重塑为国家×年份的矩阵格式,便于进行面板数据分析或缺失值评估。该数据集结构清晰,适用于分类、回归及时间序列预测等多种机器学习任务场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库整理发布,并由Electric Sheep Asia进行重新打包和标准化处理,聚焦于亚洲27个国家1996年至2025年间按性别划分的雇员月收入中位数(以当地货币计)。作为全球劳动力统计的权威来源,ILOSTAT数据库整合了各国劳动力调查、家庭收入调查等微观数据,并依据国际劳工统计学家会议(ICLS)定义进行统一协调,为研究亚洲地区性别收入差距、劳动力市场结构演变及可持续发展目标(SDG)中的体面劳动指标提供了关键支撑。该数据集涵盖831条观测值,包含性别、时间、来源等多个维度,对发展经济学、劳动经济学及公共政策研究具有重要影响。
当前挑战
所解决的领域问题核心在于亚洲地区性别收入差距的量化与监测,传统上缺乏统一、跨国的可比数据,各国统计口径、调查频率与指标定义差异显著,导致区域层面的综合分析困难重重。构建过程中面临的挑战包括:多来源数据的整合与标准化,如不同国家的劳动力调查设计差异、缺失值处理、断点序列标记;清洗时需协调货币单位、通货膨胀效应及各国数据质量标识(如B表示序列中断);此外,部分国家数据年份稀疏、样本量不均(如印尼84条与不丹21条),加之个别国家仅有零星统计,加剧了时间序列分析的局限性,需谨慎处理数据稀疏性与代表性偏差问题。
常用场景
经典使用场景
该数据集汇聚了ILOSTAT数据库中亚洲27个国家1996至2025年间按性别分列的雇员月收入中位数(以当地货币计)的831条观测记录,是研究亚洲劳动力市场收入结构的基础性面板数据。研究者常将其用于构建跨国面板模型,探讨性别收入差距的演化趋势、经济发展阶段与收入分配的关系,以及劳动力市场制度对收入水平的影响。数据集提供的性别分层字段(总、男、女、其他)使得开展性别经济学分析尤为便利,而国家与时间双重维度的覆盖则支持固定效应与随机效应等计量方法的运用。
解决学术问题
该数据集的核心价值在于填补了亚洲地区标准化、可比性的性别收入数据的长期缺口。在学术层面,它系统性地解决了跨国性别收入差异研究中的数据碎片化问题,使得学者能够克服以往依赖零散调查或单一国家数据的局限,开展跨度达三十年的面板分析。基于该数据,研究者得以实证检验人力资本理论、劳动力市场歧视理论以及全球化对性别收入平等的冲击等经典命题。其重要意义在于为国际劳工组织倡导的体面劳动与可持续发展目标(特别是SDG 8与SDG 10)提供了量化评估的基础,推动了亚洲发展经济学与劳动经济学领域的实证研究进步。
实际应用
在实际应用中,该数据集直接服务于国际组织、政府机构及非营利组织的政策制定与监测工作。例如,各国劳动与社会保障部门可借助该数据评估本国性别收入平等政策的实施效果,识别收入差距显著的行业与地区;世界银行和联合国相关机构则利用其进行区域发展报告的分析基准,为援助项目设计提供数据支撑。此外,人力资源管理咨询公司也可参考该数据开展区域性薪酬对标研究,帮助企业理解不同国家劳动力市场中性别薪酬结构的差异,从而制定更具包容性的薪酬策略。数据集以标准化格式发布,并通过HuggingFace平台直接加载,极大降低了数据获取与预处理的门槛。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别划分的雇员月收入中位数(以本币计),其研究前沿主要围绕性别薪酬差距的量化分析与动态监测。依托ILOSTAT标准化统计框架,数据集覆盖27个亚洲国家长达三十年的时序数据,为探究亚洲劳动力市场中性别平等进展、经济发展阶段与薪酬结构的关联性提供了宝贵素材。当前研究热点包括利用该数据构建预测模型,评估经济危机或政策干预对性别收入差距的冲击,以及结合多维指标揭示亚洲各国内部薪酬不平等的演化路径。该数据集的发布不仅强化了国际劳工组织在区域劳动统计中的权威地位,也为可持续发展目标中体面工作与性别平等议题的实证研究奠定了数据基石,对推动亚洲劳动市场的透明化与包容性增长具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务