遇见数据集

electricsheepasia/asia-ilo-emp-care-sex-oc2-nb-care-employment-by-sex-and-occupation-isco-level-2

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于亚洲地区有偿护理工作者就业的统计信息,具体按性别和职业(ISCO 2级分类)进行划分,数据以千人为单位。它涵盖了34个亚洲国家,时间跨度为1996年至2025年,共包含19,985个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接获取并过滤到亚洲国家。数据集的核心指标为EMP_CARE_SEX_OC2_NB,表示按性别和职业划分的护理就业人数(千计)。数据以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、性别分类、职业分类、年份、观测值等字段,并提供了数据质量说明和用法示例。该数据集由Electric Sheep Asia重新打包,旨在为机器学习研究提供标准化的亚洲数据层。

This dataset contains statistical information on paid care workers employment in Asia, disaggregated by sex and occupation (ISCO level 2 classification), with data in thousands. It covers 34 Asian countries from 1996 to 2025, comprising 19,985 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, directly pulled via its REST API and filtered to Asian country codes. The core indicator is EMP_CARE_SEX_OC2_NB, representing care employment by sex and occupation (in thousands). The dataset is organized in tabular format with columns such as country code, country name, data source, indicator code, sex classification, occupation classification, year, observed value, and includes data quality notes and usage examples. It has been repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia on HuggingFace.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-care-sex-oc2-nb-care-employment-by-sex-and-occupation-isco-level-2 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API接口直接获取指标EMP_CARE_SEX_OC2_NB的原始数据。数据经过筛选,仅保留亚洲地区34个国家(依据ISO3国家代码界定)的观测记录,并利用国际劳工统计学家会议(ICLS)定义对微观调查数据进行协调统一。原始数据来源涵盖劳动力调查、家计调查及行政记录等,在数据集中通过source.label字段进行溯源标注。最终整合为包含19,985条观测值的数据集,覆盖1996年至2025年的时间跨度。
特点
该数据集聚焦亚洲区域有偿护理就业领域,以ISCO-08职业分类第二层级进行细分,并提供按性别(总、男性、女性及其他)的分类维度。数据呈现为时间序列结构,每年度的观测值以千人为单位计量。数据集包含丰富的元数据注释,如观测状态标志(如不可靠值)及序列中断说明,便于用户评估数据质量。覆盖34个亚洲国家,其中越南、伊朗、以色列等国观测值数量超过千条,为区域劳动力市场分析提供了扎实的样本基础。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据,只需调用load_dataset函数即可获取包含所有变量的Pandas DataFrame。针对特定国家分析,可基于ref_area列进行筛选。时间序列分析可直接按年份排序并绘制折线图,以观察指标变化趋势。对于跨国家比较,推荐使用pivot_table方法构建以年份为行、国家为列的矩阵,便于多维度对比。数据以年频率发布,使用时需留意部分指标存在因方法修订导致的序列中断注释,确保分析严谨性。
背景与挑战
背景概述
在亚太地区劳动力市场转型与人口结构快速变化的背景下,照护经济(care economy)正成为衡量社会发展与性别平等的重要维度。国际劳工组织(ILO)通过其ILOSTAT数据库,自1996年起系统收集并整合了34个亚洲国家的有偿照护工作者就业数据。该数据集由Electric Sheep Asia于2025年重新打包发布,核心指标为按性别与职业分类(ISCO-08二级分类)的照护就业人数,旨在填补区域层面高分辨率照护劳动力数据的空白。其研究价值在于揭示亚洲各国在照护行业中的性别分布差异、职业结构演变以及历时性趋势,为政策制定者、劳动经济学家和可持续发展目标(SDG 8.5)的评估提供了统一的量化基础。该数据集的发布推动了学界对非正规照护就业、性别工资差距及代际照护负担的区域比较研究。
当前挑战
该数据集面对的首要领域挑战在于照护职业(如医护、教育、家政服务)在亚洲各国定义标准不一,ILO通过ICLS框架进行统一,但跨国的可比性仍受限于各国调查工具的差异。构建过程中遭遇了多重数据处理难题:首先,来自34个国家的数据源涵盖劳动力调查、行政记录与人口普查,其抽样设计、年份间方法论变更(如职业分类修订)导致统计断点;其次,数据中存在大量缺失值、异常标识(如'unreliable'标记)及来源优先级选择问题,需依赖ILO的'最佳来源'策略进行甄别;此外,年度频率限制了高频波动分析,且部分细分维度(如性别、职业分类的交叉项)因样本稀疏而无法可靠统计,增加了时间序列预测与因果推断的工程复杂度。
常用场景
经典使用场景
该数据集汇聚了1996年至2025年间亚洲34个国家按性别和职业分类的有偿照护工作者就业数据,共计19,985条观测记录,为劳动经济学和性别研究领域提供了宝贵的时间序列资料。经典的使用场景包括纵向分析亚洲各国照护行业就业规模的演变趋势,通过性别维度(男性、女性、总计)的精细划分,研究者能够深入剖析女性在照护经济中的参与度与角色变迁,揭示社会经济转型过程中照护劳动性别分工的动态特征。
衍生相关工作
围绕该数据集,已有经典工作发展为基于时间序列分解和机器学习方法的就业趋势预测模型,例如利用随机森林或长短期记忆网络建模照护就业的季节性与结构性变化。此外,性别-职业交叉分类的特性催生了不平等度量的标准化工作,衍生出地区间照护劳动性别隔离指数的计算方法。相关研究还整合ILOSTAT多指标模块,构建了亚洲照护经济综合指标体系,为后续跨数据集融合分析奠定了方法论基础。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区有偿照护就业的性别与职业结构分析,覆盖34个国家长达三十年的时序数据,为探究照护经济中性别不平等与职业分层提供了宝贵素材。当前前沿研究方向集中于利用时间序列预测模型与多分类回归方法,揭示照护工作者在ISCO二级职业分类下的性别分布动态及其与劳动力市场政策、人口老龄化和社会福利制度变迁的互动关系。结合ILOSTAT官方数据源的高可靠性与国际劳工组织标准化定义,该数据集在评估联合国可持续发展目标中体面工作与经济增长(SDG 8)以及性别平等(SDG 5)的亚洲区域进展方面具有关键作用,尤其为捕捉新冠疫情前后照护就业模式的结构性转变以及非正规照护劳动向正规化过渡的定量研究提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务