遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-ocu-nb-median-hourly-earnings-of-employees-by-sex-and-occ

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含9,009个观测值,覆盖25个亚洲国家,时间跨度为1997年至2025年,专注于一个指标:按性别和职业划分的员工每小时中位数收入(本地货币)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤到亚洲国家,涵盖了就业、工资等劳动统计信息。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、职业分类、观测年份、观测值等列,适用于表格分类、回归和时间序列预测任务。数据以年度频率发布,并经过ILO的标准化处理,确保数据质量和可比性。

This dataset contains 9,009 observations across 25 Asia countries, spanning from 1997 to 2025, focusing on one indicator: median hourly earnings of employees by sex and occupation (local currency). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to Asian countries, covering labor statistics such as employment and wages. The dataset includes columns for country codes, country names, data sources, indicator codes, sex disaggregation, occupation classification, observation years, observed values, etc., and is suitable for tabular classification, regression, and time-series forecasting tasks. The data is published at annual frequency and harmonized by ILO for quality and comparability.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-ocu-nb-median-hourly-earnings-of-employees-by-sex-and-occ 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接拉取指标代码为EAR_EHRM_SEX_OCU_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围筛选。ILO的统计部门依据国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行协调与标准化,数据来源在source.label列中予以标注,确保了跨国家与跨时期的可比性与可追溯性。最终数据集包含来自25个亚洲国家的9,009条观测记录,时间跨度覆盖1997年至2025年,由Electric Sheep Asia进行重新打包与统一发布。
特点
该数据集聚焦于按性别和职业划分的雇员小时工资中位数(以当地货币计),是亚洲区域劳动力市场分析中不可或缺的精细化指标。数据结构设计严谨,提供了ref_area(国家代码)、sex(性别分类)、classif1(职业技能水平)等关键维度列,支持从总水平到细分群体的多层次剖析。观测状态标识(obs_status)与详尽的注释字段(如note_indicator)能够反映数据中断、来源变更等质量信息,为研究者在使用时提供了充分的背景参考,增强了数据使用的透明性与可靠性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载该数据集,加载后可直接转换为pandas DataFrame进行数据探索。典型的使用包括按国家代码筛选特定国家的数据,例如过滤指代印度尼西亚的IDN代码;或针对单一指标按时间排序以绘制时间序列趋势图;还可通过数据透视表将数据重塑为国家×年份矩阵,便于面板数据分析或跨区域比较。数据集以Parquet格式封装,兼容主流数据科学工作流,适合用于表格分类、回归以及时间序列预测等多种建模任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,并由Electric Sheep Asia进行重新打包与整合,聚焦于亚洲地区按性别与职业划分的雇员中位数小时工资(以当地货币计)。其核心研究问题在于揭示亚洲25个国家在1997年至2025年间劳动报酬的性别与职业差异格局,为劳动力经济学、性别平等评估及区域发展政策提供高颗粒度的实证基础。作为ILO在体面劳动指标监测体系下的关键产出,该数据集对于追踪可持续发展目标(SDG)中关于同工同酬与公平就业的进展具有重要参考价值,尤其填补了亚洲多国跨时期、可比性工资数据的空白。
当前挑战
该数据集所应对的领域挑战在于,亚洲地区长期缺乏标准化、跨国可比的工资分性别与职业统计,导致政策制定难以精准识别报酬不平等的结构性根源。其构建过程中的挑战则包括:从ILOSTAT REST API所调取的原始调查微观数据来源复杂,涵盖劳动力调查、家庭收入调查等不同采集途径,需依据国际劳工统计学家会议(ICLS)定义进行复杂的协调与标准化清洗;同时,数据呈现显著的时空不均衡性——国家覆盖度从高密度(如柬埔寨904条记录)到低密度(如缅甸234条记录)跨度悬殊,且部分观测值伴随序列中断(Break in series)与货币单位差异等质量标注,要求使用者在分析中审慎处理跨源对比与缺失值问题。
常用场景
经典使用场景
该数据集最经典的使用场景在于对亚洲地区劳动者收入结构的时空比较分析。凭借覆盖25个亚洲国家、横跨1997至2025年的9,009条观测值,研究人员能够按性别和职业技能等级拆解时薪中位数的演变轨迹。借助时间序列分析工具,可以揭示不同国家在经济发展不同阶段中劳动报酬的差异化模式,为劳动经济学中的性别工资差距与职业隔离等经典议题提供跨国证据。
衍生相关工作
该数据集衍生了多项具有影响力的学术工作。基于ILOSTAT协调数据的应用,已有研究构建了亚洲劳动收入动态面板模型,定量分析贸易自由化与劳动力市场制度对工资收敛的影响。学者开发了融合性别与职业维度的工资不平等分解方法,揭示不同国家收入差距的结构性动因。此外,该数据被用于机器学习预测模型,利用历史收入序列与宏观经济指标预测未来劳动力成本变动趋势,推动了计算社会科学与劳动经济学的交叉创新。
数据集最近研究
最新研究方向
在亚太地区劳动力市场研究领域,该数据集基于ILOSTAT标准化统计框架,覆盖25个亚洲国家1997至2025年间按性别与职业分层的员工时薪中位数数据,为探究后疫情时代亚洲劳动报酬的结构性变迁提供了关键实证基础。当前前沿方向聚焦于结合性别薪酬差距、职业技能极化与跨国公司供应链尽责管理等热点议题,通过时间序列预测与分类回归模型,揭示数字转型与韧性经济政策对工资分配格局的长期重塑效应。该数据集的细粒度面板结构,正推动学界与政策机构在体面劳动指标监测、SDG目标追踪及区域劳动力市场一体化的量化评估中迈向更精准的刻画。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务