遇见数据集

electricsheepasia/asia-ilo-emp-cnif-sex-rt-informal-care-employment-rate-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲25个国家从2006年至2025年关于非正式护理就业率(按性别统计,%)的465个观测数据。核心指标为EMP_CNIF_SEX_RT,即Informal care employment rate by sex (%)。数据来源于国际劳工组织(ILO)的ILOSTAT中央统计数据库,该数据库是全球劳动力统计数据的主要来源。数据集经过处理和重新打包,以统一的模式(包含国家代码、国家名称、数据来源、指标、性别分类、年份、观测值等列)提供,便于直接使用`load_dataset()`加载并进行机器学习分析。数据可按性别维度(总计、男性、女性)进行细分。

This dataset contains 465 observations of the Informal care employment rate by sex (%) across 25 Asia countries, spanning from 2006 to 2025. The core indicator is EMP_CNIF_SEX_RT. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), a leading global source for labour statistics. The dataset has been processed and repackaged with a consistent schema (including columns for country code, country name, data source, indicator, sex disaggregation, year, observed value, etc.) to facilitate easy loading via `load_dataset()` and machine learning analysis. The data can be disaggregated by sex (Total, Male, Female).

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-cnif-sex-rt-informal-care-employment-rate-by-sex 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦于亚洲地区非正式护理就业率的性别分布。数据通过ILOSTAT的REST API接口直接获取,原始指标代码为EMP_CNIF_SEX_RT,并依据亚洲ISO3国家代码进行了筛选过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、住户收入调查等原始微数据进行协调统一,并在source.label列中标注了具体数据来源,确保每条记录的可追溯性。最终,Electric Sheep Asia团队对这些数据进行重新封装,形成了包含465条观测值、覆盖25个亚洲国家、时间跨度从2006年至2025年的规整数据集。
特点
本数据集以简洁而高密度的结构呈现了亚洲地区非正式护理就业率的关键信息。其核心特点在于多维度的可拆分性,除了基础的地理维度(ref_area)和时间维度(time)外,特别引入了性别拆分(sex),包含男性、女性和总计三个类别,为性别差异分析提供了直接依据。此外,数据涵盖了观测值状态标志(obs_status)及详细的注释列(如note_indicator.label),清晰说明了数据序列的中断或方法修订等质量信息,增强了数据的透明度与可靠性。整体来看,该数据集虽仅包含一个核心指标,但其结构化程度高,非常适合进行跨国家、跨时间段的比较分析。
使用方法
该数据集的使用极为便捷,主要依托HuggingFace的datasets库实现加载。用户只需一行代码`load_dataset()`即可将数据读入内存,并可直接转换为Pandas DataFrame进行后续操作。使用范例包括:按国家代码(如'IDN')过滤以获取特定国家的数据;按指标进行筛选后按时间排序,快速绘制时间序列图以观察趋势;以及利用透视表功能构建以年份为行、国家为列的矩阵,便于进行面板数据分析。数据集以Parquet格式存储,兼容器学习流水线,同时支持表格分类、回归及时间序列预测等多种任务,为劳动经济学与社会保障研究提供了高效的数据接入路径。
背景与挑战
背景概述
本数据集由国际劳工组织(ILO)统计司(ILOSTAT)编制,经Electric Sheep Asia于2025年重新打包并发布于HuggingFace平台,聚焦亚洲地区有偿照护工作者(Paid care workers)的非正规护理就业率(按性别分列)。基于ILOSTAT全球劳动统计数据库,该数据集整合了25个亚洲国家在2006至2025年间的465条年度观测数据,通过标准化流程对各国劳动力调查、家庭收入调查等原始微数据进行协调处理,以服务于劳动力市场分析、性别平等研究及可持续发展目标(SDG)中体面劳动指标的监测。作为亚洲区域首个系统性汇编非正规护理就业性别人口特征的开放数据集,其构建响应了全球对照护经济与性别分工交叉议题日益增长的关注,为经济学家、政策制定者及社会科学研究者提供了跨时间、跨国家的可比基准,进而推动了劳动力统计在非正规经济与照护劳动领域的实证探索。
当前挑战
该数据集所应对的核心领域挑战在于:精准量化亚洲地区非正规护理就业率的性别差异,需克服各国统计口径不一、数据收集频率及质量参差等难题。ILOSTAT虽采用国际劳工统计学家会议(ICLS)定义进行调和,但原始调查的覆盖率差异与“最佳来源”对同一国家-年份多重数据的选择性纳入,可能导致观测值连续性中断与代表性偏倚。构建过程中,面临数据源异构性(涉及劳动力调查、行政记录等多渠道)、时序列中因方法论修订引发的结构性断点(如指标注释中的“Break in series”),以及部分国家观测稀疏(如东帝汶仅9条记录)导致的小样本估计困境。此外,性别分类的细粒度(仅含总、男、女三类)限缩了跨性别身份与照护角色交叉分析的潜力,而年度频率难以捕捉季节性照护就业波动,从而制约了时间序列模型对短期变动的阐释力。
常用场景
经典使用场景
该数据集的核心应用在于对亚洲地区按性别划分的非正规照护就业率进行系统性的时空分析。研究者可借助其中涵盖25个国家、跨越2006至2025年的465条观测记录,构建面板数据模型,以探究非正规照护就业率的长期演进趋势与国别差异。同时,该数据为时间序列预测提供了理想基础,可运用ARIMA、状态空间模型或深度学习架构对未来的照护就业率进行推估。性别维度(总、男、女)的精细划分,使得性别差异比较与不平等度量成为可能,从而揭示劳动力市场中照护工作的性别化特征及其动态演变。
实际应用
在实际决策与产业实践层面,该数据集具有显著的应用价值。政府部门和国际组织可以据此评估各国非正规照护就业的状况,制定有针对性的劳动就业政策和社会保护体系,支持体面劳动目标的实现。非营利机构与性别平等倡导组织可利用该数据识别照护就业中的性别差距,倡导更公平的劳动报酬与工作条件。此外,关注亚洲劳动力市场的研究机构及智库,能够借助数据构建监测指标,为区域就业战略调整和可持续发展目标的进展评估提供量化依据,推动数据驱动的社会治理创新。
衍生相关工作
围绕该数据集,研究者已发展出一系列经典工作。基于ILOSTAT照护就业指标的跨国面板数据,学者们常将其与宏观经济变量、健康指标、教育水平等数据进行整合,构建了多维度劳动经济学研究的数据基础。该数据集也是时间序列预测领域常用基准之一,被用于检验各类时序模型在稀缺数据场景下的推断能力。此外,数据清洗与重包装流程为开放科学实践提供了范式,强调了从分散的政府统计API到标准化、可复现的数据集的转化路径,从而催生了更多关注数据可访问性与互操作性的基础设施研究工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务