遇见数据集

electricsheepeurope/europe-ilo-emp-care-sex-oc2-nb-care-employment-by-sex-and-occupation-isco-level-2

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和职业划分的护理就业 - ISCO 2级(千计)| 欧洲(ILOSTAT),包含19,710个观测值,覆盖15个欧洲国家(如瑞士、英国、法国、希腊、奥地利等),时间跨度为1996年至2025年。数据来源于国际劳工组织(ILOSTAT)数据库,通过其REST API提取并过滤为欧洲国家。数据集核心指标为EMP_CARE_SEX_OC2_NB,即按性别和职业(国际标准职业分类ISCO 2级)划分的有偿护理工作者就业人数,单位以千计。数据结构包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类(总计、男性、女性)、职业分类、观测年份、观测值、观测状态标志以及相关注释列。数据为年度频率,经过ILO的最佳来源选择和数据协调处理,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,便于机器学习使用。

This dataset, titled Care employment by sex and occupation - ISCO level 2 (thousands) | Europe (ILOSTAT), contains 19,710 observations across 15 European countries (e.g., Switzerland, United Kingdom, France, Greece, Austria) spanning from 1996 to 2025. The data is sourced from the International Labour Organizations ILOSTAT database, extracted via its REST API and filtered to European country codes. The core indicator is EMP_CARE_SEX_OC2_NB, which represents paid care workers employment by sex and occupation (ISCO level 2 classification), measured in thousands. The schema includes columns for country code, country name, data source, indicator code, indicator label, sex disaggregation (total, male, female), occupation classification, observation year, observed value, observation status flags, and related notes. The data is annual frequency, harmonized using ILOs best source selection, and is suitable for tabular classification, regression, and time-series forecasting tasks. The dataset is repackaged by Electric Sheep Europe in Parquet format for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-care-sex-oc2-nb-care-employment-by-sex-and-occupation-isco-level-2 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT统计数据库构建,通过其REST API直接提取‘EMP_CARE_SEX_OC2_NB’指标数据,并依据欧洲ISO3国家代码进行地域筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,数据来源在‘source.label’列中加以标注以确保可追溯性。Electric Sheep Europe团队将原始数据重新打包为Parquet格式,形成包含19,710条观测记录的整洁表格,覆盖1996年至2025年间的15个欧洲国家,每位观测均包含国家、年份、性别、职业分类及照护就业人数等核心字段。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载,使用`load_dataset()`函数即可获取格式规范的训练集,并轻松转化为Pandas DataFrame进行分析。研究者可依据`ref_area`字段筛选特定国家数据,或利用`indicator`字段聚焦特定指标进行时间序列可视化。数据还支持构建‘国家×年份’透视矩阵,便于开展面板数据回归或趋势预测。此外,数据集设计兼容表格分类、回归及时间序列预测等多种机器学习任务,用户可根据`sex`、`classif1`等拆解列灵活过滤,以适应不同研究假设与建模需求。
背景与挑战
背景概述
在劳动力市场研究中,关怀经济(care economy)作为社会可持续发展与性别平等的重要维度日益受到关注。由国际劳工组织(ILO)统计部门构建的ILOSTAT数据库,是全球劳动统计的权威来源,其发布的“europe-ilo-emp-care-sex-oc2-nb”数据集于2025年由Electric Sheep Europe重新打包为机器学习可用格式。该数据集聚焦欧洲15个国家1996至2025年间有偿护理工作者的就业状况,按性别与国际标准职业分类(ISCO-08)二级代码进行细分,涵盖19,710条观测值。其核心研究问题在于揭示欧洲区域内护理职业的就业结构、性别分布与时间演变规律,为政策制定者与社会科学研究者提供量化依据,在性别平等、劳动力迁移及社会政策评估等领域具有重要影响力。
当前挑战
该数据集面临的挑战首先源于领域问题的复杂性:关怀经济就业数据长期受限于定义模糊与统计口径不一致,跨国家、跨时期的性别与职业分类需与ILO的ICLS定义严格对齐,以解决传统劳动统计中无偿与有偿护理工作界限不清的问题。在构建层面,数据整合需克服多源异构性——原始数据来自各国劳动力调查、行政记录等多渠道,ILO虽通过‘最佳来源’机制进行优选,但观测值中仍存在‘不可靠’(obs_status=U)与‘系列断裂’(note_indicator=Break in series)等质量标记,同时部分国家年份稀疏(如西班牙仅192条记录),导致时间序列不连续与统计推断偏差,增加了模型训练与跨国比较的难度。
常用场景
经典使用场景
在劳动经济学与性别研究的交叉领域中,该数据集被广泛用于探究欧洲各国照护工作的就业结构及其演变趋势。研究者可借助其包含的性别、职业分类(ISCO二级)与时间序列信息,分析不同国家照护从业人员的规模、性别构成及职业分布特征。例如,通过时间维度的纵向比较,能够揭示1996至2025年间照护劳动力市场的发展轨迹,为理解欧洲照护经济的社会转型提供坚实的数据基础。
解决学术问题
该数据集的核心学术价值在于填补了欧洲照护就业领域标准化、跨国可比微观数据的空白。它解决了长期以来因统计口径不一导致的照护工作者规模难以准确衡量的问题,使得研究者能够系统性地评估性别分化、职业分层与制度环境之间的内在关联。其意义在于推动了照护劳动价值的社会认知,并为验证劳动力市场分割理论、性别职业隔离假说以及福利国家制度比较等经典议题提供了可靠的实证依据,深刻影响了劳动社会学与公共政策分析的学术范式。
实际应用
在实际应用层面,该数据集为国际组织、国家统计部门及政策研究机构提供了监测和评估照护劳动力市场动态的关键工具。通过分析不同性别和职业类别的就业数据,决策者能够识别照护行业的人力资源缺口,制定针对性的培训与激励政策,以应对人口老龄化与社会照护需求增长的挑战。此外,数据还可用于构建欧洲照护经济的宏观计量模型,辅助预测未来就业趋势,并为各国优化社会保障体系与劳动力市场规制提供数据驱动的决策支持。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲15国1996–2025年间按性别与职业分类的有偿护理就业规模,为分析劳动力市场中护理行业的性别分化与职业结构变迁提供了高颗粒度的时间序列证据。当前国际劳工组织(ILO)与欧盟统计局正推动以“护理经济”为核心的绿色与公正转型研究,该数据直接服务于政策评估、岗位预测及性别平等监测,尤其在新冠疫情后护理岗位价值重估与欧洲长期照护战略制定的背景下,其作为ILOSTAT官方整合的开放资料,有效填补了跨国可比精细化护理就业数据库的缺口,可支撑时序回归、分类预测及区域异质性分析,对于揭示护理职业化进程中的性别鸿沟与ISCO层级流动具有关键实证价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务