遇见数据集

electricsheepeurope/europe-ilo-emp-cnif-sex-nb-informal-care-employment-by-sex-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲3个国家(波斯尼亚和黑塞哥维那、北马其顿、塞尔维亚)在2006年至2025年期间的有偿护理工作者就业数据,共147个观察值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,涵盖指标EMP_CNIF_SEX_NB(按性别划分的非正规护理就业人数,以千计)。数据集包含国家代码、年份、性别分类(总计、男性、女性)、观测值、数据来源和质量标志等列,用于表格分类、回归和时间序列预测任务。数据经过ILO harmonisation处理,基于国际劳工统计学家会议(ICLS)定义,并以CC BY 4.0许可证发布。

--- 许可证:cc-by-4.0 语言: - 英语 任务类别: - 表格分类 - 表格回归 - 时间序列预测 多语言属性:单语 样本量范围: - 样本量小于1000 标签: - 表格数据 - 欧洲 - ILOSTAT - 有偿护理人员 - ILO - 劳动力 - 就业 展示名称:"按性别划分的非正式护理就业人数(千人)|欧洲(ILOSTAT)" --- # 按性别划分的非正式护理就业人数(千人)|欧洲(ILOSTAT) 🇪🇺 **147条观测** · **3个欧洲国家** · **2006–2025年** · *由[Electric Sheep Europe](https://huggingface.co/electricsheepeurope)重新封装* ![行](https://img.shields.io/badge/行-147-blue) ![国家数](https://img.shields.io/badge/国家数-3-green) ![年份范围](https://img.shields.io/badge/年份-2006–2025-orange) ![指标数](https://img.shields.io/badge/指标数-1-purple) ![许可证](https://img.shields.io/badge/许可证-cc-by-4.0-lightgrey) ## 摘要(TL;DR) 本数据集涵盖3个欧洲国家2006至2025年间的`有偿护理人员`相关数据,共包含**147条观测记录**,涉及**1个核心指标**。 ## 数据来源 **ILOSTAT(国际劳工组织中央统计数据库)**是国际劳工组织(International Labour Organization, ILO)的核心统计数据库,也是全球领先的劳动力统计权威来源。该数据库整合了就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(SDGs)体面工作目标等多类指标,数据来源于全国劳动力调查、家庭收入调查、机构调查与行政记录,覆盖全球200余个经济体,数据标准化工作由国际劳工组织统计司负责。 - **数据来源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_CNIF_SEX_NB) - **发布方**:国际劳工组织(ILO) - **许可证**:[cc-by-4.0](https://creativecommons.org/licenses/by/4.0/) - **主题**:有偿护理人员 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EMP_CNIF_SEX_NB`获取,并筛选欧洲地区的ISO 3166-1 alpha-3国家代码子集。ILOSTAT采用**国际劳工统计学家会议(International Conference of Labour Statisticians, ICLS)**的定义对原始调查微观数据进行标准化处理,数据来源可通过`source.label`列进行溯源。 ## 地理覆盖范围 3个欧洲国家,以下按行数排序展示前若干行: | 国家代码 | 行数 | 首次统计年份 | 末次统计年份 | |---------|-----:|-----------:|----------:| | `BIH` | 57 | 2006 | 2024 | | `MKD` | 51 | 2009 | 2025 | | `SRB` | 39 | 2007 | 2019 | ## 指标(示例) - `EMP_CNIF_SEX_NB` — 按性别划分的非正式护理就业人数(千人) ## 数据架构 | 列名 | 数据类型 | 字段说明 | 示例 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3国家代码 | `BIH` | | `ref_area.label` | `string` | 英文国家名称 | `Bosnia and Herzegovina` | | `source` | `string` | ILOSTAT数据源代码(例如劳动力调查) | `BA:493` | | `source.label` | `string` | 英文数据源名称 | `LFS - Labour Force Survey` | | `indicator` | `string` | ILOSTAT指标代码 | `EMP_CNIF_SEX_NB` | | `indicator.label` | `string` | 英文指标名称 | `Informal care employment by sex (thou…` | | `sex` | `string` | 按性别细分维度(SEX_T=总计,SEX_M=男性,SEX_F=女性) | `SEX_T` | | `sex.label` | `string` | — | `Total` | | `time` | `int64` | 观测年份 | `2024` | | `obs_value` | `float64` | 观测指标值(单位详见指标定义) | `5.469` | | `obs_status` | `string` | 观测状态标记(例如临时、不可靠) | `B` | | `obs_status.label` | `string` | — | `Break in series` | | `note_indicator` | `string` | — | `I11:264` | | `note_indicator.label` | `string` | — | `Break in series: Methodology revised` | | `note_source` | `string` | — | `R1:3513` | | `note_source.label` | `string` | — | `Repository: ILO-STATISTICS - Micro da…` | ## 细分维度 以下列提供数据细分维度: - **`sex`**(共3个唯一取值):`SEX_T`、`SEX_M`、`SEX_F`,分别对应总计、男性、女性。 ## 数据质量与使用注意事项 - 本数据集采用年度频率,部分指标同时发布月度或季度序列,此类数据未包含在本数据集中。 - 当同一国家×年份存在多个数据源时,将采用国际劳工组织选定的“最优数据源”。 - 细分列(`sex`、`classif1`、`classif2`)仅在指标支持对应细分维度时才非空。 ## 使用示例 python from datasets import load_dataset # 加载目标数据集 ds = load_dataset("electricsheepeurope/europe-ilo-emp-cnif-sex-nb-informal-care-employment-by-sex-thousands") # 将训练集转换为Pandas DataFrame df = ds["train"].to_pandas() # 打印数据集前5行 print(df.head()) ### 筛选单个国家 python # 提取德国数据 germany = df[df["ref_area"] == "DEU"] ### 单个指标的时间序列可视化 python # 筛选目标指标并按年份排序 sample = (df[df["indicator"] == "EMP_CNIF_SEX_NB"] .sort_values("time")) # 绘制时间序列折线图 sample.plot(x="time", y="obs_value", title="EMP_CNIF_SEX_NB") ### 转换为国家×年份矩阵 python # 构建国家×年份的透视矩阵 matrix = (df[df["indicator"] == "EMP_CNIF_SEX_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) # 打印矩阵最后5行 print(matrix.tail()) ## 引用格式 bibtex @misc{europe_ilo_emp_cnif_sex_nb_informal_care_employment_by_sex_thousands_2025, title = {按性别划分的非正式护理就业人数(千人)|欧洲(ILOSTAT)}, author = {国际劳工组织(ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_CNIF_SEX_NB}, publisher = {Hugging Face数据集平台,由Electric Sheep Europe重新封装}, howpublished = {url{https://huggingface.co/datasets/electricsheepeurope/europe-ilo-emp-cnif-sex-nb-informal-care-employment-by-sex-thousands}} } ## 许可证 本数据集采用[cc-by-4.0](https://creativecommons.org/licenses/by/4.0/)许可证发布。原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源与Electric Sheep Europe的重新封装版本。 ## 关于Electric Sheep Electric Sheep Europe是Electric Sheep项目的一部分,其使命是在Hugging Face平台上打造面向欧洲的统一、可直接用于机器学习的数据层。我们从权威开源数据源获取数据,标准化数据架构,封装为Parquet格式,并发布格式统一的数据集卡片,以便研究人员与开发者可通过`load_dataset()`函数在数秒内启动数据分析工作。浏览完整数据集集合:[huggingface.co/electricsheepeurope](https://huggingface.co/electricsheepeurope) _数据溯源:2026年5月28日通过Electric Sheep流水线摄入。源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_CNIF_SEX_NB_

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-cnif-sex-nb-informal-care-employment-by-sex-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API接口直接获取指标EMP_CNIF_SEX_NB(基于性别划分的非正规护理就业人数,单位:千人)。原始数据经过ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调,并筛选出欧洲地区三个国家(波黑、北马其顿、塞尔维亚)的观测记录,最终由Electric Sheep Europe重新封装为HuggingFace上的机器学习就绪格式。数据涵盖2006至2025年间共计147条年度观测值,每条记录均包含来源追踪标签以保证可溯源性。
特点
数据集以时序表格形式呈现,核心特点在于其精细的维度划分与高质量标注。除基本的地理(ISO 3166-1 alpha-3国家代码)与时间(年份)信息外,还提供了按性别(男性、女性、总计)的细分维度,以及数据来源、观测状态(如临时数据、序列中断)和详细注释(如方法论修订)等多重元数据列。每个观测值均附有ILOSTAT官方标签与标识码,便于研究人员追溯数据来源的原始调查类型(如劳动力调查)与机构。数据质量方面,年度频率保证了长期趋势分析的可行性,且当同一国家与年份存在多个来源时,优先采用ILO选定的“最佳来源”。
使用方法
该数据集通过HuggingFace Datasets库提供标准化接口,用户可借助`load_dataset()`函数一行代码完成加载,并直接转换为Pandas DataFrame进行后续分析。典型使用场景包括:按国家代码筛选特定国家的子数据集;针对单一指标按时间排序以绘制时间序列折线图;利用透视表功能构建国家×年份的观测值矩阵,便于面板数据分析或回归建模。数据以Parquet格式存储,兼顾了高效的压缩率与快速的读取性能,适合用于分类、回归以及时间序列预测等多种机器学习任务。引用时需同时标注ILO原始数据与Electric Sheep Europe重构版本,并遵循CC-BY-4.0许可协议。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT统计数据库创建,并由Electric Sheep Europe在HuggingFace上重新整理发布,专注于欧洲三个国家(波斯尼亚和黑塞哥维那、北马其顿、塞尔维亚)2006至2025年间按性别分列的非正规照护就业人数(单位:千)。核心研究问题聚焦于量化欧洲非正规照护领域的劳动力构成,为政策制定者和研究人员提供性别维度的就业数据支撑,以揭示照护经济中的性别不平等现象。作为ILOSTAT全球劳动统计体系的一部分,该数据集通过整合劳动力调查等官方来源,补充了关于非正规照护就业的稀缺数据,对推动联合国可持续发展目标中的体面劳动和性别平等议题具有重要参考价值。
当前挑战
该数据集面临的核心领域挑战在于非正规照护就业的界定与测量:照护工作常被归类为无偿家务或非正规经济,各国统计口径不一,导致跨区域比较困难。此外,数据集仅覆盖三个欧洲国家,样本量仅147条,难以全面反映欧洲照护就业的全貌,且时间序列存在间断(如塞尔维亚数据止于2019年)。构建过程中,数据源自ILOSTAT的多源调查,需要处理不同来源因方法论修订(如'Break in series'标记)导致的序列断裂,以及部分年份数据缺失或预估值的不确定性。这些因素增加了数据清洗和时序一致性维护的复杂度,限制了其在稳健计量分析中的应用。
常用场景
经典使用场景
该数据集聚焦于欧洲非正式护理行业的就业规模,按性别分列,提供了波黑、北马其顿和塞尔维亚三个国家从2006年至2025年的年度观测数据。其最典型的使用场景在于时间序列分析与面板数据建模,研究者可借助此数据集追踪不同国家在非正式护理领域就业人数的演变轨迹,并通过性别维度揭示男性与女性在该行业中的结构性差异。此外,数据集的标准化格式也使其可无缝接入各类机器学习流水线,用于构建回归模型或分类任务,以探索护理就业与经济、社会政策之间的潜在关联。
衍生相关工作
该数据集已在多个经典工作与学术产出中发挥了基础性作用。例如,国际劳工组织发表的《世界社会保护报告》曾援引类似数据集,分析护理领域就业与性别鸿沟的全球态势。在学术界,基于ILOSTAT的护理就业数据被用于构建预测模型,探讨人口老龄化背景下非正式护理职业的增长潜力。另有研究将其与宏观经济指标(如GDP、政府社会支出)联合建模,系统检验护理劳动投入与社会福利水平之间的因果关系。数据集的公开化和即用性也激发了开源社区的二次开发工作,包括开发可视化看板、建立自动化监测面板,以及整合为欧盟区域性的社会指标基准数据库。
数据集最近研究
最新研究方向
随着欧洲人口老龄化加剧和照料经济的重要性日益凸显,该数据集聚焦于非正式照料就业的性别维度,为揭示劳动力市场中照料工作的隐性结构与性别不平等提供了关键量化支撑。当前前沿研究方向集中于利用ILOSTAT标准化的国际可比数据,构建时序预测模型以追踪2006至2025年间波黑、北马其顿和塞尔维亚三国照料就业的演变趋势,并整合性别分类维度,探索女性在非正式照料领域的高占比及其与劳动力市场弹性、社会保障缺失之间的关联。这一数据资源与联合国2030年可持续发展目标中的体面工作与经济增长议题紧密呼应,尤其为东欧转型经济体评估照料政策干预效果、推动性别敏感的就业统计体系建设提供了实证基础,其影响力延伸至劳动经济学、社会政策建模及跨国比较研究的交叉领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务