遇见数据集

electricsheepeurope/europe-ilo-cld-xhaz-sex-age-ste-nb-children-in-hazardous-work-by-sex-age-and-status-i

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了欧洲15个国家在1995年至2025年间关于从事危险工作的儿童统计数据,按性别、年龄和就业状况进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API直接获取并筛选出欧洲国家。数据集共包含1,121个观测值,核心指标为“按性别、年龄和就业状况分类的从事危险工作的儿童数量(以千计)”。数据以表格形式组织,包括国家代码、数据来源、分类变量(如性别和年龄组)、观测年份、观测值及数据状态标志等列。该数据集适用于机器学习任务,如表格分类、回归分析和时间序列预测,旨在支持对儿童劳动问题的研究和政策分析。数据遵循CC BY 4.0许可协议,由Electric Sheep Europe重新打包发布。

This dataset contains statistics on children in hazardous work across 15 European countries from 1995 to 2025, disaggregated by sex, age, and status in employment. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for European countries. It includes 1,121 observations, with a core indicator measuring Children in hazardous work by sex, age and status in employment (thousands). The dataset is structured in tabular format, featuring columns such as country codes, data sources, classification variables (e.g., sex and age groups), observation years, observed values, and data quality flags. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, supporting research and policy analysis on child labor issues. The data is released under the CC BY 4.0 license and repackaged by Electric Sheep Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-cld-xhaz-sex-age-ste-nb-children-in-hazardous-work-by-sex-age-and-status-i 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接提取指标代码为CLD_XHAZ_SEX_AGE_STE_NB的数据,并依据欧洲国家ISO3代码进行地理区域过滤。原始数据来自各国劳动力调查、家庭收支调查及行政记录等多元来源,经ILO使用国际劳工统计学家会议(ICLS)定义进行标准化处理,最终由Electric Sheep Europe团队重新封装为便于机器学习使用的格式。数据集包含1,121条观测记录,覆盖1995年至2025年间15个欧洲国家的童工相关信息,每条记录均标注了数据来源的溯源标签,确保可追溯性。
特点
数据集在维度设计上展现出高度的结构化特征,不仅包含核心观测指标,还通过性别(sex)、年龄(classif1)和就业身份(classif2)三个分类维度实现了多层次的数据拆解。性别字段提供总计、男性与女性三种细分类别,年龄和就业身份字段则根据具体指标进行了灵活划分。值得注意的是,数据集中包含了观测状态标识(obs_status)和多种注释字段(note_classif、note_indicator、note_source),能够清晰反映数据质量标记、方法变更等元信息,为研究者评估数据可靠性提供了关键依据。
使用方法
使用HuggingFace Datasets库可以便捷地加载该数据集,通过load_dataset函数即可获得可直接转换为Pandas DataFrame的训练集。研究者能够针对特定国家进行子集筛选,或围绕同一指标构建时间序列进行趋势分析。数据集支持透视操作,可快速生成以年份为行、国家为列的观测值矩阵,便于进行跨国家比较与面板数据分析。加载后的数据可灵活应用于表格分类、回归预测与时间序列 forecasting 等机器学习任务,其规范的列结构使得数据探查与建模流程高度标准化。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)创建,并经Electric Sheep Europe于2025年重新打包发布,旨在系统化记录欧洲15个国家1995至2025年间儿童从事危险工作的状况。核心研究问题聚焦于揭示儿童劳动中性别、年龄及就业身份维度下的结构性差异,为联合国可持续发展目标中消除童工现象提供数据支撑。作为全球劳工统计的权威来源,ILOSTAT通过整合国家劳动力调查与行政记录,使得该数据集成为欧洲区域儿童劳动研究的重要基准,对政策制定者、国际组织与学术研究者评估劳动保护成效具有深远影响力。
当前挑战
该领域面临的核心挑战在于童工现象的隐蔽性与度量复杂性。危险工作定义因国家法律与文化差异难以统一,导致跨国比较时分类标准存在偏差。数据采集依赖各国劳动力调查,但调查频率、样本代表性及统计方法不一致,尤其对非正规经济中的童工群体覆盖不足,易产生系统性遗漏。此外,数据集构建中遭遇多重技术难题:原始数据经ILO统一处理后,仅保留‘最佳来源’条目,但不同来源间存在方法学修订所致的时间序列断裂;观察值标记为‘不可靠’的比例较高,影响模型训练的置信度;同时,部分国家仅提供少数年份的稀疏观测,这为时间序列预测与面板数据分析引入了显著的样本不平衡挑战。
常用场景
经典使用场景
该数据集收录了国际劳工组织(ILO)关于欧洲15国1995至2025年间儿童从事有害工作的观测数据,涵盖性别、年龄及就业身份等多重维度,共计1121条记录。其经典使用场景在于为社会学、劳动经济学及公共健康领域的研究者提供一个规范化的面板数据基础,用于量化分析欧洲不同国家儿童有害劳动的时空分布特征。学者可借此构建多元回归模型或时间序列分析,以揭示经济发展水平、立法强度与儿童劳动参与率之间的关联模式,从而推动对儿童劳动保护政策的实证评估。
解决学术问题
该数据集核心解决了欧洲地区儿童劳动研究中长期存在的数据碎片化与口径不统一问题。ILO采用国际劳工统计学家会议(ICLS)标准对原始调查微观数据进行协调,使其具备跨国可比性与时间一致性。基于此,研究者得以系统性地刻画性别差异、年龄分层与就业身份如何影响儿童暴露于危险工作的概率,进而验证或修正如‘贫困—教育机会短缺—劳动参与’的因果链条假设。该数据集为量化儿童劳动与经济结构转型之间的动态关系提供了可靠支撑,助力学术领域对可持续发展目标(SDG)第八项‘体面工作’的监测与反思。
衍生相关工作
基于该数据集,学术界已衍生出一系列实证研究与方法论探索。一方面,研究者利用其面板结构开展了跨国回归分析与分位数回归,探析收入水平、社会保障支出与儿童有害劳动发生率之间的非线性关系;另一方面,时间序列建模者通过ARIMA或状态空间模型对欧洲局部地区的儿童劳动趋势进行外推预测,为提前布局预防政策提供定量依据。此外,该数据还被用于构建机器学习分类模型,以识别影响儿童有害劳动的关键驱动因子,并与其他ILO数据集(如教育指标、非正式就业率)进行联合分析,推动了劳动经济学中的多源数据融合方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务