遇见数据集

electricsheepeurope/europe-ilo-emp-care-sex-how-nb-care-employment-by-sex-and-weekly-hours-actually-w

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含5,873个观测值,涵盖了14个欧洲国家从1996年至2025年的数据,重点关注EMP_CARE_SEX_HOW_NB指标,即按性别和每周实际工作小时数统计的护理就业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并筛选为欧洲国家。数据集采用表格格式,包含列如国家代码(ref_area)、年份(time)、性别分类(sex)、观测值(obs_value)等,支持按性别进行细分。数据经过ILO的标准化处理,确保与国际劳工统计会议(ICLS)定义一致,并包含数据源和质量标记。数据集适用于表格分类、回归和时间序列预测等任务,旨在为机器学习和研究提供欧洲护理就业的标准化数据。

This dataset contains 5,873 observations of Paid care workers data across 14 Europe countries, spanning 1996–2025, covering the indicator EMP_CARE_SEX_HOW_NB (Care employment by sex and weekly hours actually worked in thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via its REST API and filtered to European ISO3 country codes. It is provided in tabular format with columns such as country code (ref_area), year (time), sex disaggregation (sex), observed value (obs_value), and includes source and quality flags. The data is harmonized using ICLS definitions and supports disaggregation by sex. It is suitable for tasks like tabular classification, regression, and time-series forecasting, offering a standardized, ML-ready layer for European care employment analysis.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-care-sex-how-nb-care-employment-by-sex-and-weekly-hours-actually-w 数据集图片
构建方式
在劳动力统计领域,国际劳工组织(ILO)的ILOSTAT数据库是权威的数据枢纽。本数据集通过调用ILOSTAT REST API提取原始指标 `EMP_CARE_SEX_HOW_NB`,并依据欧洲ISO3国家代码进行地理过滤。数据来源于各国劳动力调查、家庭收入调查及行政记录,经由ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理。数据集共计5,873条观测记录,覆盖14个欧洲国家,时间跨度从1996年至2025年,最终以Parquet格式封装,便于机器学习场景下的高效加载与分析。
特点
本数据集聚焦于欧洲有偿照料从业者的就业状况,按性别和实际周工作小时数进行细分,核心指标单位以千计。其独特之处在于提供了多维度的分类变量,包括性别(男性、女性、总计)以及工作小时段分类,并附带了数据来源的可追溯标签,允许用户审慎评估数据质量。此外,数据集包含了观测状态标志与系列中断等注释信息,为研究者识别数据可靠性与方法变更提供了关键线索,从而支撑更为严谨的时间序列分析与对比研究。
使用方法
用户可通过Hugging Face的 `datasets` 库便捷加载该数据集:`load_dataset("electricsheepeurope/europe-ilo-emp-care-sex-how-nb-care-employment-by-sex-and-weekly-hours-actually-w")`,并轻松转换为Pandas DataFrame。利用 `ref_area` 列可过滤特定国家的数据,构建该国照料就业的时间序列;借助 `indicator` 与 `time` 列,可按单一指标排序并进行可视化;此外,通过 `pivot_table` 操作,研究者能快速将数据重塑为国家×年份的矩阵形式,便于执行面板数据分析或跨国家比较,极大简化了从原始统计到可分析数据集的流程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下的ILOSTAT数据库于2025年整理发布,后经Electric Sheep Europe重新封装为机器学习就绪的格式。其核心研究问题聚焦于欧洲14个国家1996至2025年间,按性别和实际周工时划分的有偿照护就业人数(单位:千人)。在劳动经济学与社会政策领域,照护工作(如护理、教育、社会服务)的性别分工是理解性别不平等、劳动力市场韧性与可持续发展目标(SDG 8)的关键切入点。该数据集通过提供标准化、可纵向比较的微观聚合数据,为跨国分析照护就业的时间趋势、性别差异以及工作强度特征奠定了坚实基础,已成为欧盟及国际社会政策研究者验证理论假设与评估政策效应的重要数据资产。
当前挑战
该数据集所要解决的领域挑战主要源于照护就业统计的复杂性与可比性缺失:各国对“照护工作者”的定义、工时统计口径(如是否包含非正规就业)及调查方法(如劳动力调查 vs. 行政记录)存在显著差异,导致传统宏观数据无法揭示细致的性别与工时结构。在构建过程中,一个核心挑战是跨源数据的一致性整合——ILOSTAT需从14个国家不同时期的多源调查中(如LFS、行政登记),根据国际劳工统计学家会议(ICLS)定义进行统一清洗与插值,同时确保“最佳来源”的优先选择不掩盖数据质量标注(如“不可靠”标记)。此外,仅发布年度频率,而割弃月/季度序列,也限制了对于短期经济冲击(如疫情)下照护就业波动的精细捕捉。
常用场景
经典使用场景
该数据集汇聚了1996年至2025年间14个欧洲国家有偿护理工作者的就业数据,并按性别与每周实际工作小时数进行细致划分。其最经典的运用场景在于构建时序预测模型与面板数据分析,研究者可借此揭示欧洲护理劳动力市场的长期演变规律。例如,通过时间序列分解方法捕捉季节性波动与结构性趋势,或利用固定效应模型考察各国护理就业的异质性路径。数据的高频年度观测与标准化ILO编码体系,使其成为检验劳动力市场理论、量化性别就业差异及评估护理经济价值的理想实证基础。
实际应用
在实际应用层面,该数据集为国家间护理劳动力配置效率的基准测试提供了量化工具。政策制定者可借助它监测各国护理行业就业增长是否匹配人口老龄化需求,并基于性别与工时分项数据设计精准的劳动力激活策略。例如,识别出高比例兼职女性护理人员的国家,可据此调整弹性工作激励措施。对于国际组织而言,该数据集是追踪可持续发展目标中体面劳动指标进展的关键数据源,尤其适用于评估护理工作正规化与性别薪酬差距弥合等政策干预的实效。
衍生相关工作
该数据集衍生出一系列极具影响力的学术工作。在方法论层面,它催生了针对跨国面板数据的缺失值插补与调查框架衔接修正技术,如基于ILO最佳来源选择的鲁棒性校验流程。在实证研究领域,基于该数据开发的护理就业预测模型已成为欧洲社会政策模拟的基准组件,其生成的性别化护理就业弹性系数被后续研究广泛引用。此外,数据集与ILOSTAT其他模块的联动分析孕育了融合就业质量与工作时长的多维福祉指标体系,相关成果发表于《劳动经济学》等顶级期刊,重塑了护理劳动价值评估的学术范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务