遇见数据集

electricsheepasia/asia-ilo-emp-care-sex-ocu-nb-care-employment-by-sex-and-occupation-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲34个国家从1996年至2025年的有偿护理工作者数据,共有12,083个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,核心指标为EMP_CARE_SEX_OCU_NB,即按性别和职业划分的护理就业人数(以千为单位)。数据集涵盖国家代码、数据来源、指标代码、性别分类、观测年份、观测值及其状态等信息,适用于表格分类、回归和时间序列预测等自然语言处理任务。数据通过ILOSTAT REST API获取,并经过标准化处理,以Parquet格式发布,便于机器学习使用。

This dataset contains 12,083 observations of paid care workers data across 34 Asia countries, spanning from 1996 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, with the key indicator EMP_CARE_SEX_OCU_NB, representing care employment by sex and occupation in thousands. It includes columns such as country codes, data sources, indicator codes, sex classifications, observation years, observed values, and status flags, suitable for tabular classification, regression, and time-series forecasting tasks. The data is retrieved via the ILOSTAT REST API, normalized, and published in Parquet format for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-care-sex-ocu-nb-care-employment-by-sex-and-occupation-thousands 数据集图片
构建方式
该数据集由Electric Sheep Asia团队通过ILOSTAT的REST API接口直接获取,原始指标为EMP_CARE_SEX_OCU_NB(按性别和职业划分的有偿护理就业人数,单位:千人)。数据经筛选后仅保留亚洲34个国家的ISO3代码所对应的观测值,并使用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调。数据来源标记于source.label列以供溯源,最终整合为包含12,083条观测记录的整洁表格,覆盖1996年至2025年的时间跨度。
特点
数据集的核心特点在于其精细的多维分类结构:除了提供国家(ref_area)和年份(time)两个基础维度外,还包含性别(sex,含总计、男性、女性三个类别)以及职业技能水平(classif1)等分类变量。每个观测值均附有详尽的数据质量说明,如obs_status标记(含不可靠等状态),以及notes系列字段记录方法论修订、非标准职业分类等元信息。数据来源于各国劳动力调查、行政记录等多重渠道,经ILO优选最佳来源,保证了亚洲地区有偿护理劳动力统计的权威性与可比性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据集,转化为Pandas DataFrame进行探索分析。典型应用包括:按国家代码筛选特定国家的护理就业时间序列;利用obs_value字段绘制单一指标的年度变化曲线;或通过pivot_table构建以年份为行、国家为列的区域对比矩阵。数据集支持分类、回归和时间序列预测等机器学习任务,其标准化的Schema设计使得跨国家、跨性别的统计分析尤为便捷。
背景与挑战
背景概述
在劳动经济学与性别研究交叉领域,无偿照料劳动向有偿照料就业的转化是衡量社会经济发展与性别平等进程的关键指标。国际劳工组织(ILO)长期致力于构建全球一致的劳动统计框架,其ILOSTAT数据库作为最具权威性的就业数据源之一,涵盖了超过200个经济体的劳动力调查指标。由Electric Sheep Asia于2025年重新打包发布的“asia-ilo-emp-care-sex-ocu-nb-care-employment-by-sex-and-occupation-thousands”数据集,聚焦亚太地区34国,收录了1996年至2025年间共计12,083条有偿照料就业观测值。该数据集以性别与职业为划分维度,系统呈现了亚洲各国在医疗服务、教育、社会照料等岗位上的劳动力分布格局,为探究照料经济规模、性别职业隔离及劳动力市场结构性变迁提供了标准化、机器可读的时空序列数据,填补了区域级细致度照料就业数据集的空白。
当前挑战
该数据集所解决的核心领域挑战在于:长期缺乏按性别与职业双重维度细分且覆盖亚洲多国的有偿照料就业时间序列数据,导致区域间照料经济比较分析因数据来源分散、统计口径不一而受阻。在构建过程中,面临来自ILOSTAT原始数据中的多源异构性挑战,不同国家依赖劳动力调查、行政记录等不同采集方式,且在年度频次下存在部分观测值缺失或标记为不可靠(如obs_status字段为‘U’的情形)。此外,职业分类体系(classif1)的多变性与数据注释字段(如note_classif)中提及的非标准职业编码,增加了跨时间与跨国别一致化处理的复杂度。数据集还需应对各指标来源的ILO选定机制带来的稀疏性,以及性别与职业维度在部分观测中的空值问题,以确保下游时间序列预测和分类回归任务的可靠性。
常用场景
经典使用场景
在亚洲劳动经济学与性别研究的交叉领域中,该数据集最经典的使用场景是构建面板数据模型,以探析亚洲34个国家1996至2025年间有偿照护工作者就业人数的时序演变与跨国差异。研究者可基于性别与职业分类维度,运用时间序列预测或分类回归方法,剖析不同社会经济环境下照护就业规模的动态路径,从而揭示亚洲区域照护经济的结构性特征与发展趋势。
解决学术问题
该数据集有效回应了长期困扰劳动经济学界的几个关键问题:如何系统量化亚洲区域内照护工作者的性别分布与职业分层,如何弥补跨国照护就业面板数据的缺失,以及如何评估各国照护就业政策对劳动力市场的实际效应。其意义在于为检验照护经济理论、分析性别就业差距以及探究人口老龄化背景下照护需求的劳动力供给响应提供了坚实的实证基础,推动了亚洲劳动统计学的前沿研究。
衍生相关工作
该数据集催生了一系列具有影响力的衍生工作,包括基于性别视角的照护就业跨国比较研究、结合机器学习方法预测照护劳动力需求的前沿探索,以及将照护就业数据与国家健康支出、老龄化指标融合的综合分析框架。这些工作深化了对亚洲照护经济异质性的理解,后续研究者还进一步开发了数据可视化工具包与自动化的面板数据清洗流程,有效降低了劳动科学领域使用该数据的技术门槛。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务