遇见数据集

electricsheepasia/asia-ilo-ear-shra-sex-nb-average-hourly-earnings-of-stem-employees-local-cu

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲21个国家在2007年至2025年期间关于STEM(科学、技术、工程和数学)员工平均小时收入(以本地货币计)的393个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API获取并过滤为亚洲国家。数据集涵盖了唯一指标EAR_SHRA_SEX_NB,提供了按性别(总计、男性、女性)分列的年度数据,并包括国家代码、来源、观测值、时间年份等详细列信息。数据经过ILO harmonisation处理,使用国际劳工统计学家会议(ICLS)定义,确保一致性和可追溯性。数据集适用于表格分类、回归和时间序列预测等任务,旨在为亚洲地区的劳动经济研究提供机器学习就绪的数据支持。

This dataset contains 393 observations on the average hourly earnings of STEM (Science, Technology, Engineering, and Mathematics) employees in local currency across 21 Asian countries from 2007 to 2025. Sourced from the ILOSTAT database of the International Labour Organization (ILO), the data is retrieved via the ILOSTAT REST API and filtered for Asian countries. It includes a single indicator EAR_SHRA_SEX_NB, with annual data disaggregated by sex (total, male, female), and features detailed columns such as country codes, sources, observed values, and time years. The data is harmonized by the ILO using International Conference of Labour Statisticians (ICLS) definitions for consistency and traceability. Suitable for tasks like tabular classification, regression, and time-series forecasting, the dataset provides machine learning-ready data for labor economics research in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-shra-sex-nb-average-hourly-earnings-of-stem-employees-local-cu 数据集图片
构建方式
该数据集由Electric Sheep Asia对国际劳工组织(ILO)的ILOSTAT统计数据库进行重新打包而构建。数据通过调用ILOSTAT REST API接口获取指标为EAR_SHRA_SEX_NB的原始数据,并过滤出亚洲地区ISO3国家代码的观测记录。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据集中的source.label字段追溯了每一条观测的数据来源,确保了数据的可溯源性。最终汇集了21个亚洲国家从2007年至2025年间的393条观测。
特点
该数据集聚焦于亚洲地区STEM(科学、技术、工程和数学)雇员的平均时薪(以当地货币计价),是研究亚洲劳动力市场中高技能人才薪酬结构的稀缺资源。其突出特点在于包含性别维度(总计、男性、女性三类)的分组信息,可支持性别薪酬差异的深入分析。数据集覆盖了越南、柬埔寨、土耳其等21个亚洲国家,时间跨度近二十年,并附有观测状态标识(如序列中断、临时数据),便于用户评估数据质量与适用性。
使用方法
该数据集可通过HuggingFace的datasets库轻松加载,用户只需调用load_dataset函数即可获得可直接使用的pandas DataFrame格式数据。支持按国家代码进行过滤以聚焦特定区域分析,也可针对单一指标进行按时间排序的时间序列可视化。通过透视表功能,用户可以快速构建年份与国家交叉的薪酬矩阵,便于面板数据分析。数据集已按标准化的Parquet格式存储,确保了高效的读取速度和机器学习就绪性,适用于计量经济学研究、劳动力市场建模及政策评估等多元场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,并经Electric Sheep Asia重新封装,聚焦于21个亚洲国家2007至2025年间STEM雇员平均时薪的本地货币计量。作为全球劳动力统计的权威来源,ILOSTAT整合了各国劳动力调查、行政记录等多源数据,该数据集针对亚洲区域STEM从业者的薪酬水平进行观测,为研究科技人才流动、区域经济差异及劳动力市场结构提供了关键量化基础。其影响力在于填补了亚洲跨国STEM薪酬比较的数据空白,支撑可持续发展目标中的体面劳动评估,并为跨国企业与政策制定者提供了纵向时序分析工具。
当前挑战
领域层面,该数据集致力于解决STEM领域劳动力市场薪酬数据的跨国可比性与时序一致性挑战。由于各国统计方法、数据收集频率及职业分类标准存在差异,跨区域比较面临口径不统一与数据稀疏性问题。构建过程中,研究人员需协调ILOSTAT的多源异构数据,处理因调查变更导致的时序断点(如观测状态标注'Break in series'),并筛选最优源数据以避免同一国家年份内的重复条目。此外,数据集仅包含年度频率,缺失月度和季度分辨率,限制了高频经济波动分析;少数国家观测点稀疏(如印度仅12条),可能引发统计偏差与泛化困难。
常用场景
经典使用场景
在劳动经济学与教育政策研究领域,该数据集的核心用途在于分析亚洲地区STEM从业者的小时工资水平及其动态演变趋势。凭借覆盖21个亚洲国家、横跨2007至2025年的年度观测值,研究者可开展跨国面板数据分析,构建固定效应或随机效应模型,以揭示经济发展阶段、产业结构转型与STEM薪酬之间的内在关联。数据按性别细分,为探索劳动力市场中的性别工资差异提供了宝贵素材,成为评估科技人才吸引力和留存策略的定量基础。
实际应用
在实际应用中,数据集服务于多边组织、国家统计部门和智库的政策评估与监测工作。国际劳工组织可藉此跟踪亚洲各国在可持续发展目标(SDGs)中体面工作指标的进展,特别是目标8.5所关注的公平薪酬。发展机构借助该数据分析区域STEM教育投资的经济回报率,为制定奖学金、职业培训等人才扶持计划提供成本效益参考。跨国企业则利用薪酬时序数据优化区域员工薪酬结构,确保在泰国、越南等不同市场间维持竞争力与内部公平性。
衍生相关工作
该数据集衍生的相关工作涵盖了多项基于ILOSTAT的跨国比较研究。典型的衍生课题包括:运用分位数回归方法探究不同薪酬水平下STEM工资溢价的异质性;结合世界银行或OECD的产业数据,分析科技创新投入与STEM薪酬增长之间的滞后相关性;以及通过双重差分法评估国家科技园区政策对当地STEM从业人员薪资的因果效应。此外,基于该数据开发的机器学习模型可用于预测未来五年亚洲各国STEM薪酬增长率,为教育资源配置和劳动力规划提供前瞻性工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务