遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-ocu-nb-median-monthly-earnings-of-employees-by-sex-and-oc

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格数据集,包含亚洲26个国家按性别和职业划分的雇员月收入中位数(本地货币)数据,源自国际劳工组织(ILO)的ILOSTAT数据库。数据涵盖1996年至2025年,共10,945个观测值,核心指标为“EAR_EMTM_SEX_OCU_NB”。数据集适用于表格分类、回归和时间序列预测任务,包含国家代码、来源、性别、职业分类、年份、观测值等列,并提供了数据质量说明和使用示例。

This dataset is a tabular dataset containing median monthly earnings of employees by sex and occupation (local currency) for 26 Asian countries, sourced from the International Labour Organization (ILO) ILOSTAT database. It spans from 1996 to 2025 with 10,945 observations, and the core indicator is EAR_EMTM_SEX_OCU_NB. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, and includes columns such as country code, source, sex, occupation classification, year, observed value, along with data quality notes and usage examples.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-ocu-nb-median-monthly-earnings-of-employees-by-sex-and-oc 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库。数据通过ILOSTAT REST API直接采集,接口地址为`https://rplumber.ilo.org/data/indicator?id=EAR_EMTM_SEX_OCU_NB`,并依据亚洲ISO3国家代码进行地理范围过滤。ILOSTAT利用国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、家庭收入调查、企业调查及行政记录等原始微观数据进行协调处理,以确保跨国的可比性。Electric Sheep Asia团队将原始数据重新打包为Parquet格式,生成了包含10,945条观测记录的整洁数据集。
特点
该数据集收录了1996年至2025年间亚洲26个国家的雇员月收入中位数数据,以本地货币计价。其核心特点在于提供了按性别(男性、女性、总计)和职业技能水平(基于ISCO分类)的双重细分维度,使研究者能够深入分析劳动力市场的性别薪酬差距与职业结构差异。数据集中每条观测记录均附带详细的来源标记(source.label)和观测状态说明(obs_status.label),便于用户追溯数据质量和来源层级。此外,数据覆盖时间跨度达三十年,为长期趋势分析提供了坚实的数据基础。
使用方法
用户可通过HuggingFace的`datasets`库便捷加载该数据集,调用`load_dataset("electricsheepasia/asia-ilo-ear-emtm-sex-ocu-nb-median-monthly-earnings-of-employees-by-sex-and-oc")`即可获取,并能直接转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选特定子集(如印度尼西亚的数据),针对单一指标进行时间序列可视化,或利用透视表构建国家×年份的矩阵以进行跨区域比较。研究者还可依据`sex`和`classif1`等分类列对数据进行分组聚合,深入探究薪酬的性别与职业异质性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布,并经Electric Sheep Asia重新封装,聚焦于亚洲26个国家1996至2025年间雇员按性别和职业划分的中位数月薪(以当地货币计价)。核心研究问题在于揭示亚洲地区劳动报酬的性别与职业差异,为劳动经济学、收入不平等及区域发展研究提供标准化数据支撑。其影响力体现在为政策制定者、研究人员提供可跨时空比较的收入基准,推动联合国可持续发展目标中体面工作目标的量化监测,尤其填补了亚洲多国官方统计数据的整合缺口。
当前挑战
该数据集面临的挑战多元而深刻。领域层面,核心问题在于跨越1996至2025年、涵盖26个亚洲国家的收入数据在货币单位、调查方法及时间跨度上存在巨大异质性,直接比较时面临通胀校正、购买力平价转换及统计口径统一的难题。构建过程中,ILOSTAT需从各国劳动调查、行政记录等多源异构数据中提取并协调,克服了数据缺失、序列中断及命名分类不一致等障碍,例如数据集明确标注的‘break in series’状态标识即反映了这一技术困境。此外,性别维度的细分仅含四种分类,未能捕获非二元性别或交叉性职业分层,限制了不平等研究的深度;职业分类仅按技能水平汇总,缺乏行业或职业细粒度的匹配,可能掩盖结构性的工资歧视模式。
常用场景
经典使用场景
该数据集收录了ILOSTAT中亚洲26国1996至2025年按性别与职业划分的雇员月收入中位数数据,共计10,945条观测。在劳动经济学与不平等研究领域,研究者常将其用于构建性别收入差距的面板模型,通过固定效应或随机效应回归,剖析职业隔离与性别薪酬鸿沟的演变趋势。同时,时序分析中可借助该数据追踪各国收入中位数的长期波动,揭示经济转型与劳动力市场结构性变迁的动态特征。其按职业技能等级的分类维度,为探究技能溢价、行业间收入分化提供了精细的量化支撑。
衍生相关工作
该数据集的衍生工作广泛渗透于劳动经济学的前沿研究。经典文献常将其与ILOSTAT其他指标(如失业率、劳动参与率)合并,构建亚洲劳动力市场综合监测体系。部分研究以此为基准,结合世界银行收入分配数据,验证库兹涅茨曲线在亚洲的适用性。近年来,机器学习领域的学者利用其时间序列与分类特征,开发了预测各国收入中位数演进趋势的回归模型,以及识别职业隔离模式的无监督聚类算法。这些工作不仅拓展了劳动统计数据的计算社会科学应用,更为政策模拟提供了数据驱动的预测工具。
数据集最近研究
最新研究方向
该数据集整合了ILOSTAT官方渠道下亚洲26国1996至2025年间按性别与职业分层的中位数月收入数据,为区域劳动经济学中的性别薪酬差距与职业收入极化议题提供了高分辨率的结构化支撑。基于10,945条观测,研究者可借助时间序列预测与多元回归框架,深入探究亚洲新兴经济体在全球化与产业转型进程中收入不平等动态演化规律,尤其适合围绕性别收入收敛性、技能溢价变迁以及劳动力市场制度异质性展开交叉分析。该数据的分层粒度与国家跨度亦契合近期关于非正规就业、数字平台经济对薪酬结构冲击的前沿热点,为跨国比较政策评估与SDG体面劳动目标的量化监测提供了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务