遇见数据集

electricsheepasia/asia-ilo-ear-chra-sex-cur-nb-average-hourly-earnings-of-care-employees-by-sex-a

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲地区护理员工的平均小时收入数据,按性别和货币分类。数据源自国际劳工组织(ILO)的ILOSTAT统计数据库,由Electric Sheep Asia重新打包。数据集涵盖24个亚洲国家,时间跨度为1997年至2025年,共包含1,287个观测值,涉及一个核心指标(EAR_CHRA_SEX_CUR_NB)。数据字段包括国家代码、国家名称、数据来源、指标代码、性别分类、货币类型、年份、观测值等,用于支持表格分类、回归和时间序列预测等任务。

This dataset contains average hourly earnings of care employees in Asia, disaggregated by sex and currency. It is sourced from the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Asia. The dataset covers 24 Asian countries from 1997 to 2025, with 1,287 observations and one main indicator (EAR_CHRA_SEX_CUR_NB). The schema includes columns such as country code, country name, data source, indicator code, sex classification, currency type, year, observed value, etc., suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-chra-sex-cur-nb-average-hourly-earnings-of-care-employees-by-sex-a 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接抽取了标识为EAR_CHRA_SEX_CUR_NB的指标数据,并依据ISO 3166-1 alpha-3编码筛选出亚洲国家的观测记录。数据涵盖了1997年至2025年间24个亚洲国家的1287条观测值,聚焦于按性别和货币分类的护理雇员平均时薪。原始数据经由国际劳工组织统计局依据国际劳工统计学家会议定义进行统一协调,来源信息在source.label字段中予以标注,以确保数据的可追溯性和一致性。
特点
数据集兼具多维性与细粒度特征,提供按性别(总、男、女、其他)拆分的细分维度,同时包含观测值的质量状态标记(如系列中断、初步数据等),便于研究者评估数据可靠性。其地域覆盖广泛,涵盖柬埔寨、越南、土耳其等24个亚洲经济体,时间跨度近三十年,为纵向比较提供了丰富的时序数据。此外,数据集还保留了原始调查来源、货币类型等分类变量,支持从多角度剖析亚洲护理行业薪酬结构的演变趋势。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据集,并将其转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码过滤子集(如Indonesia数据)、按时间序列对单一指标进行可视化分析,或通过数据透视表构建国家-年份的矩阵格式,便于开展跨区域对比研究。数据集以Parquet格式发布,结构清晰,各列均配有详细的英文描述,降低了数据清洗与整合的复杂度,使得研究人员能够迅速聚焦于亚洲护理人员薪酬的实证探索。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT创建,并经Electric Sheep Asia于2025年重新整理与封装,专注于亚洲地区护理从业者的小时收入问题。研究背景植根于全球劳动经济学中护理工作价值的凸显,特别是在性别收入差异与货币换算复杂性交织的亚洲语境下,亟需一个标准化、可比较的微观数据基础。数据集收录了1997至2025年间24个亚洲国家共计1,287条观测,聚焦于按性别与货币分类的护理雇员平均小时收入这一核心指标,为探索护理劳动市场的地域差异、性别工资鸿沟及货币汇率影响提供了宝贵的结构化数据。其发布极大地便利了跨国家、跨时期的经济计量分析与机器学习建模,对亚洲劳动力市场研究、社会政策制定及可持续发展目标监测产生了实质性的推动作用。
当前挑战
该数据集在领域问题上所应对的核心挑战在于:护理工作在全球范围内普遍存在价值低估和性别薪酬不平等,而亚洲地区因国家发展水平悬殊、统计口径不一及货币种类繁多,导致跨国比较异常困难。数据集通过ILOSTAT的标准化定义与数据调和机制,初步缓解了上述问题。然而在构建过程中面临着显著挑战:原始数据源自各国不同类型的调查(如劳动力调查、家庭收支调查),其抽样框架、问卷设计与统计方法存在系统差异,虽经ILO标记来源字段,但异质性难以完全消除;数据质量方面,部分观测带有“序列中断”等状态标记,影响了时间序列的连续性;同时,数据仅为年度频率且部分国家年份稀疏,限制了高精度时间序列建模与实时分析的能力。
常用场景
经典使用场景
该数据集收录了1997至2025年间24个亚洲国家有偿护理工作者的平均小时收入,按性别与货币进行细致划分,共计1287条观测记录。在学术研究与政策分析中,它常被用于构建面板数据模型,以探究亚洲地区护理行业薪资水平的时空演变规律。研究者可借助该数据开展性别薪酬差距的跨国比较分析,通过固定效应或随机效应模型控制国家与年份的异质性,揭示工资在护理部门内的动态分布特征。此外,时间序列分析亦为经典范式,研究者可基于各国逐年数据进行趋势预测或结构性断点检验,从而把握经济转型与劳动力市场政策对护理报酬的长期影响。
实际应用
在实际应用中,该数据集为国际组织、政府劳工部门及非政府机构制定护理行业薪酬政策提供了关键数据支撑。它可用于构建区域性的劳动力市场监测仪表盘,实时追踪不同性别护理工作者的收入变动,从而诊断性别薪酬失衡的严峻区域。社会企业可借此数据进行行业基准分析,设定公平薪酬标准以提升护理职业的社会认可度。此外,数据集还可融入教育机构的数据分析课程,作为时间序列与面板数据处理的典型教学案例,培养数据驱动的社会问题分析能力。对于发展融资项目,该数据能够辅助评估薪酬干预措施的实际效果,优化养老与健康照护领域的投资策略。
衍生相关工作
基于该数据集的标准化结构,已有研究衍生出若干前沿工作。在方法论层面,学者们利用其多维度分类特征(性别、货币类型)发展了适用于护理行业的薪酬分解方法,如Oaxaca-Blinder分解结合倾向得分匹配的交叉验证框架。在工具开发方面,Electric Sheep Asia提供的API接口催生了基于Python的自动化薪酬分析流水线,使得从ILOSTAT原始API到建模就绪数据集的转换流程成为可复用的开源工具。此外,该数据集被整合进亚洲劳动力市场主题的基准测试语料库,用于训练与评估机器学习模型在缺失值插补与区域递推预测任务中的表现,进而推动了兼顾性别细粒度的面板数据方法在劳动统计领域的标准化应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务