遇见数据集

electricsheepeurope/europe-ilo-cld-xhaz-sex-age-geo-nb-children-in-hazardous-work-by-sex-age-and-rural-ur

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了关于欧洲14个国家(1995年至2025年)童工情况的1,052条观测数据,具体指标为CLD_XHAZ_SEX_AGE_GEO_NB,即按性别、年龄和城乡地区划分的从事危险工作的儿童数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过筛选仅包含欧洲国家。数据集提供了多维度的分类信息,包括国家(ISO代码和名称)、数据来源(如劳动力调查)、性别(总计、男性、女性)、年龄组、地区类型(如全国范围)、观测年份、观测数值以及数据状态标志(如不可靠数据标记)。数据以年度频率发布,涵盖了奥地利、瑞士、匈牙利、罗马尼亚、爱沙尼亚、俄罗斯、马耳他、摩尔多瓦、波兰、乌克兰、法国、斯洛文尼亚、白俄罗斯和希腊等国家。数据集旨在支持表格分类、回归和时间序列预测等任务,适用于研究童工问题的趋势和模式分析。

This dataset contains 1,052 observations on child labour across 14 European countries from 1995 to 2025, focusing on the indicator CLD_XHAZ_SEX_AGE_GEO_NB, which measures the number of children in hazardous work (in thousands) disaggregated by sex, age, and rural/urban areas. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via its REST API and filtered for European countries. It includes multi-dimensional classifications such as country (ISO codes and names), data source (e.g., labour force surveys), sex (total, male, female), age groups, area type (e.g., national), observation year, observed values, and data status flags (e.g., unreliable indicators). The data is published annually and covers countries including Austria, Switzerland, Hungary, Romania, Estonia, Russia, Malta, Moldova, Poland, Ukraine, France, Slovenia, Belarus, and Greece. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, supporting research on trends and patterns in child labour.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-cld-xhaz-sex-age-geo-nb-children-in-hazardous-work-by-sex-age-and-rural-ur 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦欧洲地区儿童从事有害劳动的状况。数据通过ILOSTAT REST API直接获取,原始指标代码为CLD_XHAZ_SEX_AGE_GEO_NB,经筛选仅保留欧洲ISO3国家代码的相关记录。ILOSTAT依据国际劳动统计学家会议(ICLS)的定义对各国劳动力调查、住户收入调查等微观数据进行统一协调与标准化处理,确保跨国家跨年份数据的一致性与可比性。Electric Sheep Europe团队对原始数据进行了重新封装,整合为包含1052条观测记录的整洁表格,覆盖14个欧洲国家及1995至2025年间的时间跨度,并以Parquet格式发布,便于机器学习与数据科学工作流直接使用。
特点
该数据集的核心特点在于其精细的多维度分层结构。数据不仅提供按性别(男性、女性、总计)划分的儿童有害劳动参与人数估计值,还通过classif1与classif2字段纳入了年龄组别(如15-17岁)以及地理覆盖范围(国家层面、城乡区域)的交叉分类。每个观测值均附有详细的来源标记(source.label字段),可追溯至具体调查类型(如劳动力调查),并包含观测状态标识(obs_status字段)以区分数据的可靠性等级。这种丰富的标签体系允许研究者针对特定亚群进行深入分析,例如比较城市与农村环境中不同年龄段儿童的有害劳动暴露差异。
使用方法
使用者可通过HuggingFace Datasets库以一行代码加载该数据集:`load_dataset("electricsheepeurope/europe-ilo-cld-xhaz-sex-age-geo-nb-children-in-hazardous-work-by-sex-age-and-rural-ur")`。加载后训练集可直接转换为Pandas DataFrame进行后续操作。典型应用场景包括按国家筛选特定地区的子集(如df[df["ref_area"] == "DEU"])、针对单一指标进行时间序列可视化(按年度排序obs_value并绘图)、以及构建国家×年份的透视矩阵以便于面板数据分析或预测建模。数据以年度频率呈现,缺失值通过ILO选择的“最佳来源”填充,使用者应注意观测状态标志(如U表示不可靠)以评估数据质量。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT整理发布,具体由Electric Sheep Europe于2025年重新封装,涵盖了1995年至2025年间14个欧洲国家中儿童从事危险工作的1052条观测记录。数据按性别、年龄及城乡地域进行精细分层,旨在系统量化儿童在危险劳动环境中的暴露规模与分布特征。作为全球劳动统计的权威来源,ILOSTAT通过标准化国际劳工统计学家会议定义,整合国家劳动力调查等原始微观数据,为监测可持续发展目标中的体面劳动指标提供了关键数据基础。该数据集聚焦欧洲区域,弥补了以往全球性评估中区域细粒度不足的缺陷,对制定针对性儿童劳动保护政策具有重要支撑作用。
当前挑战
该数据集面临的首要挑战在于儿童危险劳动数据采集本身的敏感性,受调查伦理与社会隐匿性影响,受访者可能隐瞒真实劳动状况,导致观察值存在系统性低估。构建过程中,ILOSTAT需协调多个国家不同统计体系间的定义差异与时间序列断裂,例如部分国家仅提供特定年份数据(如乌克兰仅2015年记录),造成面板数据非平衡性。数据质量标注显示存在大量‘不可靠’状态值,暗示部分国家抽样框架或调查实施存在局限。此外,城乡分类与年龄分组的差异化定义(如15-17岁年龄组)限制了跨国严格可比性,而时间维度上年度频率无法捕捉季节性劳动波动,削弱了政策干预的动态评估能力。
常用场景
经典使用场景
该数据集聚焦于欧洲14个国家中从事危险工作的童工群体,按性别、年龄及城乡地理维度进行精准分解,提供了1995年至2025年间长达三十年的观察数据。研究者可基于这些多维分类变量,构建分类模型以识别哪些人口特征与高风险劳动参与高度关联,或利用回归分析探究不同社会经济背景下童工数量的演变规律。借助时间序列预测方法,学术界能够建模并预估未来数年相关指标的变化趋势,从而为区域劳动政策制定提供前瞻性参考。
解决学术问题
该数据集有效回应了劳动经济学与发展研究中长期悬而未决的难题:如何在缺乏统一标准的跨国比较中,精确刻画欧洲童工面临职业危害的时空分布特征。通过整合国际劳工组织(ILO)依据国际劳动统计学家会议定义协调后的微观调查数据,研究者得以规避各国调查口径不一带来的偏误,量化性别鸿沟、城乡差异及年龄段异质性。数据集的价值在于推动了量化评估体面劳动目标(SDG 8.7)实现进程的方法论革新,为建模治理效能与儿童福利改善之间的因果路径奠定了数据基石。
衍生相关工作
该数据集衍生出的一系列相关工作主要集中在三个方向:一是基于其分类结构开发可解释的机器学习模型,以揭示危险童工现象的驱动力;二是构建多国面板数据库,融合GDP、教育投入等社会经济协变量,展开因果推断研究,评估政策干预对童工数量缩减的边际效应;三是催生了与ILOSTAT其他指标(如失业率、非正规就业比例)的交叉分析工作,推动形成更完整的欧洲劳动力市场弱势群体画像。部分研究还利用该数据验证了贝叶斯时间序列模型在少样本跨国预测中的稳健性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务