遇见数据集

electricsheepasia/asia-ilo-emp-care-sex-edu-nb-care-employment-by-sex-and-education-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含32个亚洲国家从1996年至2025年的4,000个观测值,专注于按性别和教育程度划分的护理就业(以千为单位)指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为亚洲国家代码。数据集涵盖1个独特指标(EMP_CARE_SEX_EDU_NB),提供按性别(总计、男性、女性等)和教育程度分类的就业数据。数据以年度频率发布,包括国家代码、年份、观测值、数据来源和质量标志等信息,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,以Parquet格式发布,便于机器学习使用。

This dataset contains 4,000 observations of paid care workers data across 32 Asia countries, spanning from 1996 to 2025, covering 1 distinct indicator: Care employment by sex and education (thousands). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via REST API and filtered to Asia ISO3 country codes. The data includes disaggregation by sex (total, male, female, etc.) and education, with annual frequency, and provides information such as country codes, years, observed values, data sources, and quality flags. It is repackaged by Electric Sheep Asia in Parquet format for machine learning readiness, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-care-sex-edu-nb-care-employment-by-sex-and-education-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接拉取特定指标'EMP_CARE_SEX_EDU_NB'的数据,并依据亚洲ISO3国家代码进行地理过滤。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调统一,数据来源涵盖劳动力调查、家庭收入调查、机构调查及行政记录等,并在'source.label'列中标注溯源信息。数据集由Electric Sheep Asia团队重新打包,将其转化为机器学习就绪格式,包含约4000条观测记录,覆盖1996年至2025年间的32个亚洲国家。
特点
本数据集聚焦于亚洲地区有偿照护工作者的就业情况,按性别与教育水平进行精细划分,包含单一核心指标(EMP_CARE_SEX_EDU_NB),单位以千计。其独特之处在于提供了多维度分层信息,包括性别(SEX_T总、SEX_M男、SEX_F女、SEX_O其他)以及教育分类变量(classif1),并附有数据质量标记(如provisional、unreliable)与系列断裂等注释,便于研究人员评估数据可靠性。此外,数据集采用年度频率,并优先选用ILO确认的'最佳来源',确保数据权威性。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据,使用`load_dataset()`命令即可获得可直接转换为Pandas DataFrame的训练集。数据分析途径多样:可按国家代码(如'ref_area'列为'IDN')筛选特定国家的时间序列;也可按指标代码(如'EMP_CARE_SEX_EDU_NB')过滤后,利用'obs_value'列进行时序数据可视化或建模。进一步,可通过pivot_table函数重塑为国家×年份的矩阵格式,便于进行面板数据分析或时间序列预测任务,适用于归类分析与回归分析等多种研究场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库整理发布,并由Electric Sheep Asia在HuggingFace平台重新封装,专注于亚洲32个国家1996年至2025年间有偿护理工作者的就业情况,包含约4000条观测数据。研究核心在于按性别与教育水平对护理行业就业进行精细化解构,旨在揭示亚洲地区护理劳动力市场的结构性特征。作为ILO全球劳动统计体系的关键组成部分,该数据集为追踪可持续发展目标中体面工作相关指标提供了可靠依据,尤其在量化女性在护理经济中的参与度与教育回报率方面具有重要参考价值,推动了区域劳动经济学与性别研究的实证分析。
当前挑战
该数据集所解决的领域挑战在于,护理经济作为全球就业增长最快的领域之一,其劳动力数据在亚洲多国长期存在统计口径不一、性别与教育层面信息缺失的问题,导致区域比较与政策制定缺乏可靠基础。构建过程中面临的核心挑战包括:跨32个国家原始调查数据因劳动统计定义(ICLS)与调查方法(如劳动力调查与行政记录)差异导致的数据异质性需统一整合;多来源数据中‘最佳来源’的选择逻辑需兼顾一致性;以及部分年份与国家数据存在‘不可靠’或‘方法论修订导致序列中断’等质量标记,需在保持统计稳健性的同时保留数据可追溯性,这对下游时间序列分析与跨国比较提出了严谨的预处理要求。
常用场景
经典使用场景
该数据集收录了1996年至2025年间亚洲32个国家中有偿照护工作者按性别与教育程度划分的就业数据,共计约4000条观测记录。其经典使用场景集中于劳动经济学与性别研究领域,研究者可借助此数据集探究亚洲地区照护经济中劳动力结构的演变规律。通过时间序列分析,能够揭示不同性别群体在照护行业中的参与率差异,并进一步结合教育分类变量,评估教育水平对女性进入照护劳动力市场的推动作用。此外,跨国家面板数据的特性使得跨国比较研究成为可能,有助于识别经济发展程度、社会政策与文化背景如何塑造照护就业格局。该数据集为理解亚洲照护工作的性别化分工提供了坚实的数据基础。
实际应用
在实际应用层面,该数据集为国际组织、政府部门及非营利机构制定照护经济政策提供了不可或缺的参考依据。政策制定者可依据不同国家照护就业的性别比例与教育构成,设计更具针对性的职业培训计划,鼓励男性进入照护行业以缓解劳动力短缺,同时提升照护工作的专业化与薪酬水平。在公共卫生危机(如流行病)期间,该数据有助于评估照护服务供给的脆弱性,指导应急劳动力调配。此外,私营部门中的医疗与养老服务机构可借助该数据洞察区域人才市场趋势,优化人力资源战略。该数据集还支持开发基于机器学习的就业预测模型,为亚洲照护经济的可持续发展提供数据驱动的决策支持。
衍生相关工作
基于该数据集的衍生研究推动了照护劳动领域的知识深化。典型工作包括构建亚洲照护就业追踪数据库,整合历年数据形成标准化的面板结构,为后续计量分析提供便利。学者们以此为基础开展了照护工作的性别工资差距的跨国研究,揭示了教育程度对薪资回报的非线性影响。另有工作聚焦于照护就业与人口老龄化、女性劳动参与率之间的动态关联,利用时间序列模型预测未来劳动力供给趋势。该数据集还激发了关于照护政策分类体系的研究,探讨不同国家在照护工作者统计定义上的异同如何影响跨国比较的效度。这些衍生工作不仅丰富了照护经济学的理论框架,也为政策模拟与评估提供了可复现的数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务