遇见数据集

electricsheepasia/asia-ilo-ear-phra-sex-cur-nb-average-hourly-earnings-of-public-sector-employees

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲24个国家公共部门员工按性别和货币分类的平均小时收入数据,涵盖1997年至2025年期间的1,542个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并经过标准化处理,确保与ILO定义一致。数据集包含唯一指标EAR_PHRA_SEX_CUR_NB,提供了国家代码、数据来源、性别分类、观测年份、数值及状态标志等详细信息,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并经过ILO的最佳来源筛选,部分数据包含细分维度如性别(总计、男性、女性)。数据集由Electric Sheep Asia重新打包,以方便机器学习使用,遵循CC-BY-4.0许可证。

This dataset contains average hourly earnings of public sector employees by sex and currency across 24 Asian countries, with 1,542 observations spanning the years 1997 to 2025. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and harmonized using ILO definitions. It features a single indicator EAR_PHRA_SEX_CUR_NB and includes details such as country codes, data sources, sex disaggregation, observation years, values, and status flags, suitable for tasks like tabular classification, regression, and time-series forecasting. The data is annual, filtered by ILOs best source selection, with some dimensions like sex (total, male, female) provided. Repackaged by Electric Sheep Asia for machine learning readiness, it is licensed under CC-BY-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-phra-sex-cur-nb-average-hourly-earnings-of-public-sector-employees 数据集图片
构建方式
该数据集源于ILOSTAT数据库,由国际劳工组织(ILO)精心构建并维护,其核心指标为公共部门雇员按性别和货币计算的平均时薪。数据通过ILOSTAT REST API直接拉取,并筛选出亚洲24个国家的ISO3国家代码。ILO的统计部门依据国际劳工统计学家会议的定义对原始调查微观数据进行协调处理,每一观测值的来源均在`source.label`列中标注,确保了数据的可追溯性。此数据集的二次打包与发布由Electric Sheep Asia完成,旨在为研究人员和开发者提供一个经过格式规范、可直接加载的机器学习就绪数据集。
特点
本数据集的一大特点在于其精炼而专注的维度设计。数据集共包含1,542个观测值,时间跨度从1997年至2025年,覆盖了亚洲24个极具代表性的国家。其核心指标仅为一个,即公共部门雇员的平均时薪,但通过性别(sex)和货币(classif1)两个关键维度进行精细分解,提供了诸如总、男、女以及本地货币与美元等分类。这种简洁而聚焦的结构避免了信息冗余,虽然不含月度或季度数据,但所有记录均保持年度频率,并采用ILO选定的“最佳来源”,保证了数据的一致性与权威性。
使用方法
使用者可通过HuggingFace的`datasets`库轻松调用该数据集,只需一行代码`load_dataset`即可将其加载为Pandas DataFrame。加载后,可根据`ref_area`列筛选特定国家的数据,例如`df[df['ref_area'] == 'IDN']`可获取印度尼西亚的观测值。针对时间序列分析,可对`obs_value`按`time`排序并绘图。若需构建国家-年份矩阵,可利用`pivot_table`方法以`time`为索引、`ref_area`为列、`obs_value`为值进行透视,从而快速生成面板数据结构,便于进行跨国的宏观比较与回归分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)下属的ILOSTAT统计数据库创建,并由Electric Sheep Asia于2025年重新打包发布,专注于亚洲地区公共部门雇员的时薪收入研究。其核心研究问题在于揭示性别与货币维度下公共部门劳动力报酬的时空演变规律,涵盖24个亚洲国家从1997年至2025年的1,542条观测记录。作为全球劳动统计的权威来源,ILOSTAT通过整合劳动力调查、行政记录等多源数据,为经济学、劳动社会学及公共政策分析提供了标准化基准。该数据集的面世填补了亚洲公共部门薪酬研究高频微观数据的空白,推动了区域劳动经济学实证分析的精细化进程,尤其为跨国薪资比较、性别收入差距评估及劳动力市场政策效果检验奠定了数据基础。
当前挑战
该数据集面临的挑战主要源于领域问题的复杂性与构建过程的技术障碍。在领域问题层面,亚州各国公共部门薪酬体系差异显著,汇率波动、购买力平价调整及非正规就业的隐性报酬使跨国比较面临内生性挑战;性别收入差距的成因涉及制度、文化及职业隔离等多维因素,难以通过单一指标充分刻画。构建过程中,数据来自各国不同时期的劳动力调查,存在调查方法、分类标准与质量标签(如数据中断标识)的不一致性,ILOSTAT虽采用国际劳动统计学家会议定义进行协调,但源数据中‘最佳来源’的选择逻辑及非年度频率数据的缺失仍需审慎对待。此外,经济时序数据的滞后性与政策冲击的时变效应,为时间序列建模与因果推断增添了难度。
常用场景
经典使用场景
该数据集在劳动经济学与公共政策研究领域,为分析亚洲地区公共部门雇员的薪酬结构提供了宝贵的微观数据支撑。研究者可借此追踪24个亚洲国家自1997年至2025年间,按性别与货币单位划分的公共部门平均时薪变迁轨迹。通过时序回归与面板数据分析,学者能够刻画不同经济体在公共部门薪酬水平上的异质性特征,并量化性别收入差距的动态演变。此外,数据集中丰富的分类变量——如性别聚合维度与观测状态标记——使得模型能够同时纳入结构性断点与序列可靠性修正,从而提升对公共部门劳动力市场运行规律的推论精度。
衍生相关工作
围绕此数据集,劳动经济学与数据科学领域已衍生出若干富有启发性的研究脉络。一方面,基于该时序面板数据,学者们构建了公共部门薪酬预测模型与结构性断点检测框架,用以分析金融危机、政策改革或统计方法变更对工资序列的干预效应。另一方面,性别维度的精细分层催生了多篇聚焦亚洲公共部门性别收入差距收敛速度的实证研究,相关论文常采用双重差分或分位数回归方法。此外,该数据也被整合进更大的ILOSTAT全球劳动统计数据库中,成为开发跨区域薪酬比较可视化仪表盘的关键数据源,推动了开源劳动经济分析工具的发展。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区公共部门雇员按性别和货币分列的平均时薪,为劳动经济学中的薪酬公平性、性别收入差距以及公共部门就业质量评估提供了关键时序指标。当前前沿研究方向正围绕后疫情时代亚洲公共部门薪资恢复轨迹展开,尤其关注2023-2025年间菲律宾、柬埔寨、土耳其等国数据的动态变化,以揭示结构性调整与通胀压力对实际购买力的影响。结合ILOSTAT统一的统计框架与ICLS定义,该数据集在跨国比较、性别差异分析及时间序列预测中具有重要价值,为国际劳工组织倡导的体面劳动目标(SDG指标8.5)提供了量化支撑,推动了亚洲劳动力市场政策评估的精准化与数据驱动决策的科学化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务