遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-cct-nb-average-monthly-earnings-of-employees-by-sex-and-c

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲16个国家(如马来西亚、文莱、泰国等)2007年至2024年的员工月平均收入数据,以本地货币计量,并按性别和国籍进行细分。数据集共有627个观测值,涵盖1个核心指标(EAR_EMTA_SEX_CCT_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过调查和行政记录收集,并经过标准化处理。数据集以表格形式提供,包括国家代码、年份、性别分类、观测值及其状态等列,适用于表格分类、回归或时间序列预测等机器学习任务。

This dataset contains average monthly earnings of employees in local currency for 16 Asia countries from 2007 to 2024, disaggregated by sex and citizenship. It includes 627 observations covering one key indicator (EAR_EMTA_SEX_CCT_NB), sourced from the ILOSTAT database of the International Labour Organization (ILO), with data harmonized from surveys and administrative records. The dataset is provided in tabular format with columns such as country code, year, sex classification, observed value, and status, suitable for tabular classification, regression, or time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-cct-nb-average-monthly-earnings-of-employees-by-sex-and-c 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,该数据库整合了各国劳动力调查、家庭收入调查及行政记录等原始微观数据,并依据国际劳动统计学家会议(ICLS)定义进行标准化处理。研究人员通过ILOSTAT REST API直接获取指标为EAR_EMTA_SEX_CCT_NB的原始数据,随后基于亚洲ISO3国家代码进行地域筛选与过滤,最终形成涵盖16个亚洲国家、横跨2007至2024年间的627条观测记录。数据集还保留了来源标识(source.label)字段,以确保数据的可追溯性。
特点
该数据集聚焦于亚洲地区雇员按性别与公民身份划分的平均月收入(以当地货币计),其结构性特征鲜明:包含ref_area(国家代码)、sex(性别分类,含总数、男性、女性三类)、classif1(公民身份分类)、time(年份)及obs_value(观测值)等核心字段。数据频率为年度,且ILO已为同一国家与年份的多源数据遴选出“最佳来源”。此外,样本覆盖马来西亚、文莱、泰国等16国,其中马来西亚的观测记录最为丰富(102条),时间跨度从2011年至2024年,展现出良好的时间序列完整性。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据:使用`load_dataset("electricsheepasia/asia-ilo-ear-emta-sex-cct-nb-average-monthly-earnings-of-employees-by-sex-and-c")`获取数据集,并将其轻松转换为Pandas DataFrame进行后续分析。具体应用场景包括:按国家代码筛选单一国家数据(如印度尼西亚);按特定指标排序并绘制时间序列折线图;或利用pivot_table方法将数据重塑为国家×年份的矩阵结构,便于进行跨区域面板数据分析。数据集的简洁Schema设计使得从描述性统计到计量经济建模的各类研究均可高效开展。
背景与挑战
背景概述
在全球劳动力市场研究中,薪酬水平的性别差异与公民身份差异是一项关键议题,直接关联到社会公平与可持续发展目标的实现。国际劳工组织(ILO)作为全球劳动统计的权威机构,通过其ILOSTAT数据库持续发布涵盖就业、失业、工资等领域的标准化指标,为跨国比较与政策制定提供基础数据支撑。在此背景下,Electric Sheep Asia于2024年整理并发布了该数据集,聚焦亚洲16个国家2007至2024年间雇员平均月薪的性别与公民身份分层数据,包含627条观测记录。该数据集经由ILOSTAT官方API获取,并采用国际劳工统计学家会议(ICLS)定义进行规范化处理,为区域经济不平等研究、劳工市场动态分析以及性别薪酬差距的量化评估提供了不可或缺的纵向数据资源,显著推动了亚洲劳动经济学领域的实证研究进程。
当前挑战
该数据集所应对的领域挑战主要源于亚洲地区劳动力市场数据的碎片化与非标准化。不同国家在薪酬统计的采集频率、调查方法(如劳动力调查与家庭收支调查)及定义上存在显著差异,导致跨越国界的直接比较面临方法论障碍。同时,公民身份与性别维度的薪酬分层数据尤为稀缺,许多国家的官方统计中缺乏对非本国籍劳动者薪酬的系统性记录,使得对移民劳工经济融入状况的分析长期处于空白。在数据集构建过程中,核心挑战在于从ILOSTAT庞杂的原始API中精确筛选亚洲国家观测,并处理各国在数据时间跨度与指标定义上的不一致性,例如部分国家存在多个数据源,需依据ILO推荐的“最佳来源”进行择优整合。此外,数据质量标志(如“不可靠”标记)的识别与保留,要求用户具备对统计标识的深度理解,以避免误用于政策敏感场景。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集被广泛应用于分析亚洲不同国家雇员平均月收入的性别差异与公民身份差异。研究者可借助其按性别(男性、女性、总计)与公民身份(本地与外国)细分的收入指标,构建面板数据模型,揭示经济发展阶段、劳动力市场制度与收入不平等之间的内在关联。该数据的时间跨度为2007至2024年,覆盖16个亚洲经济体,为跨国比较与纵向趋势分析提供了坚实基础。
解决学术问题
该数据集有效解决了亚洲地区跨国收入数据获取困难、指标定义不统一的关键学术瓶颈。过去,由于各国统计体系差异,研究者在进行性别收入差距的国际比较时常因数据不可比而受限。该数据集通过国际劳工组织(ILO)的标准化流程,整合各国调查数据,使学者能够在控制制度差异的同时,精确检验全球化、移民政策与劳动力市场分割对收入分配的影响,为发展经济学与劳动经济学提供了可靠的经验证据。
衍生相关工作
该数据集衍生了一系列围绕亚洲劳动力市场收入结构的经典研究。代表性工作包括利用面板数据模型探讨外国劳工流入对本地居民工资的溢出效应,以及基于性别分解的收入流动性与歧视指数测算。部分学者进一步将其与移民存量数据结合,构建多层级模型分析公民身份与职业隔离的交互作用。这些研究推动了从传统跨国回归向因果推断方法的演进,成为后续标准化劳动统计数据库建设的参照基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务