遇见数据集

electricsheepasia/asia-ilo-emp-care-sex-ste-nb-care-employment-by-sex-and-status-in-employment-th

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于亚洲地区有偿护理工作者就业的统计数据,按性别和就业状态分类,以千人为单位。数据集覆盖34个亚洲国家,时间跨度为1996年至2025年,共包含2,865个观测值。核心指标为EMP_CARE_SEX_STE_NB(按性别和就业状态分类的护理就业数据,以千人为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并过滤为亚洲国家代码,经过标准化处理以符合国际劳工统计学家会议(ICLS)的定义。数据集由Electric Sheep Asia重新打包,以Parquet格式提供,便于机器学习和分析使用。数据列包括国家代码、国家名称、数据源、指标代码、性别分类、就业状态分类、年份、观测值、观测状态及相关注释,支持多维度的数据分析和时间序列预测。

This dataset contains statistical data on paid care workers employment in Asia, disaggregated by sex and status in employment, measured in thousands. It covers 34 Asian countries from 1996 to 2025, with 2,865 observations. The key indicator is EMP_CARE_SEX_STE_NB (Care employment by sex and status in employment, in thousands). Data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via the REST API and filtered to Asian country codes, harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset is repackaged by Electric Sheep Asia in Parquet format for machine learning and analytical use. Columns include country codes, country names, data sources, indicator codes, sex classifications, employment status classifications, year, observed values, observation status flags, and related notes, supporting multi-dimensional analysis and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-care-sex-ste-nb-care-employment-by-sex-and-status-in-employment-th 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲地区有偿护理工作者的就业情况。数据通过ILOSTAT REST API直接采集,API端点返回指标代码为EMP_CARE_SEX_STE_NB的观测值,随后依据亚洲国家ISO3代码进行地理范围筛选。ILOSTAT依据国际劳动统计学家会议(ICLS)定义对原始调查微观数据进行协调处理,确保跨国可比性。数据集中每条记录均附带来源标签,便于追溯原始调查性质,如劳动力调查或行政记录。作为Electric Sheep Asia项目的再包装成果,原始数据经规范化处理后以Parquet格式存储,并统一发布至HuggingFace平台。
特点
该数据集包含2,865条观测值,覆盖34个亚洲国家,时间跨度自1996年至2025年,呈现长期面板数据结构。其核心指标为按性别和就业身份分类的有偿护理工作人员数(单位:千),并进一步通过性别维度(总、男、女、其他)与就业身份分类进行细致分解。数据来源以劳动力调查为主,辅以其他官方统计渠道,多源记录经ILO优选后保留最佳来源。数据质量标识明确,包含观测状态标记与系列中断注释,为研究者提供重要的数据可靠性参考。年度频率的设计使该数据集适用于时间序列分析、跨国比较及劳动经济学研究。
使用方法
通过HuggingFace的datasets库可便捷加载该数据集,执行from datasets import load_dataset后调用load_dataset函数即可获取训练集。加载后,借助Pandas库转换数据框,用户可按国家代码筛选特定国家数据,或针对单个指标进行时间序列可视化。数据框支持以时间为索引、国家为列进行透视表操作,便于构建区域面板数据。列结构清晰,涵盖区域代码、来源、指标、性别、分类变量及观测值等字段,研究者可直接利用这些标准化字段进行统计建模或机器学习任务。数据集遵循CC-BY 4.0许可协议,使用时需同时引用ILO原始来源及Electric Sheep Asia的再包装贡献。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT创建,并由Electric Sheep Asia团队重新整理发布,聚焦于亚洲34个国家1996至2025年间有偿护理从业者的就业状况。核心研究问题在于揭示性别与就业身份维度下护理劳动力的分布格局及其演变趋势,为劳动力市场研究、性别平等评估及社会政策制定提供跨时空的量化依据。作为全球劳动统计的重要来源,ILOSTAT的数据经严格方法协调,覆盖200余个经济体,该数据集则进一步将视角聚焦于亚洲区域,弥补了该地区在护理经济研究领域精细化时序数据的不足,对推动可持续发展和体面劳动目标的实证分析具有重要影响力。
当前挑战
该数据集所应对的领域挑战在于护理经济长期被主流劳动统计所忽视,尤其是亚洲地区因国家间数据口径不一、调查频率参差、性别与就业身份的分层信息零散,导致对护理工作者的规模、结构及变化趋势难以进行可靠比较。构建过程中的挑战表现为:ILOSTAT需从多来源——包括劳动力调查、家庭收支调查与行政记录——中抽取并统一微观数据,借助国际劳动统计学家会议定义进行协调,而同一国家同年份可能面临多源数据冲突,仅能依赖ILO原则选取“最佳来源”;此外,时间序列中存在因方法修订导致的断点标记,性别与就业身份等核心分类维度亦非所有观测均完整披露,对数据清洗与纵向分析构成限制。
常用场景
经典使用场景
在劳动经济学与性别研究的交叉领域中,该数据集的核心使用场景在于揭示亚洲地区有偿照护工作的性别差异与就业身份分布特征。研究者可基于34个国家跨越近三十年的观测数据,构建面板回归模型,系统评估经济发展水平、社会保障政策与文化规范如何塑造女性在照护行业中的就业占比及职业地位(如雇员与自雇者的比例)。这一分析框架为理解亚洲劳动力市场中性别分工的演变提供了宝贵的实证基础。
解决学术问题
该数据集有效回应了关于非正规就业与照护劳动价值评估的学术难题。传统劳动力调查往往难以捕捉照护工作者在性别与就业身份维度的精确分布,而本数据通过ILOSTAT标准化分类,提供了年度高频的细分指标。研究者得以量化有偿照护行业的规模及其对性别工资差距、劳动权益保障的影响,从而推动对可持续生计与体面工作目标的学术讨论,为国际劳动组织倡导的政策干预提供经验证据。
衍生相关工作
该数据集衍生出若干经典研究工作,尤其在性别与劳动交叉领域。基于同一ILOSTAT来源的研究已构建全球照护工作者时空演变图谱,发表在国际劳动组织工作论文与《Feminist Economics》等期刊。研究者进一步融合微观调查数据,利用本数据集的时间序列特性训练自回归模型,预测亚洲各国照护就业的收敛趋势。此外,该数据集被重封装为机器学习基准,推动表格数据与时序预测任务的跨学科评测,成为连接劳动统计与数据科学的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务