遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-ind-cur-nb-average-hourly-earnings-of-employees-by-ilo-sector

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按ILO部门、性别和货币划分的员工平均小时收入 | 亚洲(ILOSTAT)”,包含29,390个观测值,覆盖22个亚洲国家(如土耳其、越南、柬埔寨等),时间跨度为2005年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,这是一个全球劳动力统计的主要来源,通过标准化调查数据(使用国际劳工统计学家会议定义)收集。数据集包含一个核心指标:EAR_EHRA_SEX_IND_CUR_NB,即按ILO部门、性别和货币划分的员工平均小时收入。数据以表格形式组织,包括列如国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性等)、时间年份、观测值(收入数值)以及数据质量标志(如不可靠)。数据为年度频率,经过ILO的“最佳来源”选择处理,并提供了分类维度(如性别)以支持详细分析。该数据集由Electric Sheep Asia重新打包,以机器学习友好的格式(Parquet)发布,便于使用Hugging Face的datasets库直接加载和分析。

The dataset, titled Average hourly earnings of employees by ILO sector, sex and currency | Asia (ILOSTAT), comprises 29,390 observations across 22 Asian countries (e.g., Turkey, Vietnam, Cambodia), spanning the years 2005 to 2025. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), a leading global repository for labour statistics, which harmonizes raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions. The dataset focuses on a single indicator: EAR_EHRA_SEX_IND_CUR_NB, representing average hourly earnings of employees disaggregated by ILO sector, sex, and currency. Data is structured in tabular format with columns including country code, country name, source code, indicator code, sex classification (total, male, female, etc.), time year, observed value (earnings), and data quality flags (e.g., unreliable). It is annual frequency data, with ILOs best source selection applied for duplicate entries, and includes disaggregation dimensions such as sex for granular analysis. Repackaged by Electric Sheep Asia in a machine-learning-ready format (Parquet), it allows easy loading and analysis via Hugging Faces datasets library.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-ind-cur-nb-average-hourly-earnings-of-employees-by-ilo-sector 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接提取特定指标(EAR_EHRA_SEX_IND_CUR_NB)的数据,并依据亚洲国家ISO3代码进行过滤。数据涵盖了2005至2025年间22个亚洲国家的29,390条观测记录,每条记录均包含国家代码、来源、指标、性别、行业分类、货币类型及观测年份等字段。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,并在source.label列中标记数据来源以确保可追溯性。最终数据由Electric Sheep Asia重新打包为HuggingFace数据集格式,便于机器学习应用。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,只需一行代码即可将其转换为Pandas DataFrame进行后续分析。具体操作包括按国家代码过滤以聚焦特定地区,或者按指标排序后绘制时间序列图以观察趋势变化。进一步地,可以通过数据透视表将数据重塑为国家×年份的矩阵形式,便于跨国家比较。数据集包含了近3万条高质量观测记录,适用于分类、回归或时间序列预测任务。使用时应遵循CC-BY-4.0许可协议,并引用原始ILO数据源及Electric Sheep Asia的重新打包版本。
背景与挑战
背景概述
在全球劳动力市场研究领域,工资水平是衡量经济健康发展与劳动者福祉的核心指标之一,尤其在亚太地区,经济转型与结构变革使得精准、可比的薪资数据成为政策制定与学术研究的稀缺资源。该数据集由国际劳工组织(ILO)统计部门于2025年发布,并经Electric Sheep Asia重新打包整合,涵盖22个亚洲国家自2005年至2025年间约29,390条观测数据,聚焦于按ILO部门、性别和货币分类的员工平均时薪。该数据的核心研究问题在于填补区域间薪资数据在时间跨度和细分维度上的空白,为劳动经济学、不平等研究与可持续发展目标监测提供跨国产出可比的基础支撑。凭借ILO统计数据库的权威性及其标准化方法论,该数据集已成为分析亚洲劳动力市场变动、性别工资差异及行业收入结构的重要参考,推动区域劳动政策研究迈向量化与实证化。
当前挑战
该数据集所应对的领域挑战主要源于亚洲各国劳动统计体系在定义、分类与收集周期上的异质性,导致跨国家、跨时间的工资数据难以直接比较,传统分析常受限于样本窗口狭窄或分类标准缺失。构建过程中面临的核心障碍包括:从ILOSTAT API接入原始数据时需处理大量来源标志与状态标签,如通过“source.label”和“obs_status”字段识别数据可靠性与调查来源,但部分欠发达国家仅能提供不稳定或预估值;时间精度上仅支持年度频率,而月度和季度序列被排除,难以满足高频经济波动分析需求;同时,性别与行业分类仅在部分国家有完整披露,导致数据在“sex”和“classif1”等维度存在大量空值,削弱了细粒度交叉分析的完整性。此外,多来源数据中ILO仅保留“最佳来源”,隐含着数据选择和调和过程中的信息损失风险,进一步考验用户在实证研究中的审慎处理能力。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中关于亚洲22个经济体2005至2025年间按行业、性别及货币分类的雇员平均时薪观测值,共计29,390条记录。其经典使用场景在于为劳动经济学研究者提供了一套标准化的面板数据,用于构建跨国薪资动态的统计分析模型。无论是通过线性回归探讨性别工资差距的时间演变趋势,还是运用面板数据固定效应模型识别行业结构对薪资水平的异质性影响,该数据集都能提供翔实且具备时序连续性的基础变量。同时,研究者亦可借助该数据进行时序预测,利用自回归移动平均或长短期记忆网络等模型,对未来特定行业的薪资走向做出前瞻性推断。
解决学术问题
在劳动力市场研究的学术前沿,一个长期存在的难题是如何在缺乏统一口径的各国官方统计数据之间建立可比性。该数据集通过采用ILO统一的国际劳动统计学家会议(ICLS)定义进行数据协调,有效解决了跨国薪资比较中的测量偏误问题,使得研究者得以从制度经济学视角出发,量化分析经济发展水平、产业政策与劳动力报酬之间的因果关联。此外,按性别维度拆分的数据为研究劳动市场中的性别歧视提供了一个可靠的量化基础,使学者能够通过分解方法(如Oaxaca-Blinder分解)精确估计个人特征无法解释的薪资差距部分,从而揭示隐性结构性障碍的具体规模。
实际应用
实际应用层面,该数据集是国际发展机构、各国劳动部门及非政府组织进行劳动市场监测与政策评估的重要工具。通过追踪各国每小时平均收益的波动轨迹,政策制定者可以及时识别薪资增长停滞或剧烈下跌的预警信号,为最低工资标准的上调时机和幅度提供实证依据。在跨国企业进行亚洲市场投资决策时,该数据能够帮助人力资源部门区分不同国家和行业的劳动力成本结构,优化薪酬预算与运营布局。同时,该数据集也支撑着各类可持续发展目标(SDG)监测报告中对体面工作指标的追踪,为中亚及东南亚国家的劳动政策改革成效提供可量化的基准。
数据集最近研究
最新研究方向
在亚太地区劳动力市场结构性变迁与后疫情时代收入分配失衡的宏观背景下,该数据集的前沿研究方向聚焦于利用ILOSTAT标准化的跨国产出,构建基于性别的行业小时收入动态监测框架。研究者正借助这一包含22国、横跨二十载的年度面板数据,结合时序预测与机器学习模型,剖析数字经济和绿色转型等热点事件对不同ILO行业性别工资差距的异质性冲击。其核心意义在于为联合国可持续发展目标中体面工作的量化评估提供亚洲维度的实证锚点,尤其通过精细化的来源标记与分类维度,推动了从描述性统计向因果推断和情景模拟的方法论跃迁,对区域性收入趋同政策及跨国劳动制度比较研究产生了范式性的催化作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务