electricsheepeurope/europe-ilo-cld-xhaz-sex-age-geo-rt-share-of-children-in-hazardous-work-by-sex-age-and
收藏数据链接:
官方服务:
资源简介:
该数据集包含欧洲14个国家(1995年至2025年期间)按性别、年龄和城乡区域划分的儿童从事危险工作比例(%)的观测数据,共1,043个观测值,覆盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涉及童工主题,通过API获取并经过欧洲国家筛选处理。
This dataset contains 1,043 observations of the share of children in hazardous work by sex, age and rural/urban areas (%) across 14 Europe countries, spanning from 1995 to 2025, covering 1 distinct indicator. It is sourced from ILOSTAT, the International Labour Organizations statistics database, focusing on child labour, and is repackaged for machine learning readiness.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
该数据集由Electric Sheep Europe基于国际劳工组织(ILO)的ILOSTAT数据库重新打包而成。数据通过ILOSTAT REST API直接拉取,筛选出欧洲ISO3国家代码,并整合了14个欧洲国家在1995至2025年间关于儿童危险劳动的指标。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行统一处理,确保了跨国的可比性。每个观测值均附有数据来源标识,便于追溯原始调查类型,如劳动力调查或行政记录。
特点
数据集包含1,043条观测记录,聚焦于“按性别、年龄及城乡地区划分的儿童从事危险劳动的比例”这一核心指标。其独特之处在于提供了多维度的细分维度,包括性别(总、男性、女性)及年龄和地理区域分类。数据涵盖了从奥地利到俄罗斯等多样化的欧洲国家,时间跨度长达三十年,且标注了观测状态(如不可靠值)以警示数据质量。数据集以表格形式呈现,变量包括国家代码、指标值、来源注释等,便于直接用于回归或时间序列分析。
使用方法
用户可通过HuggingFace的`datasets`库轻松加载该数据集,调用`load_dataset("electricsheepeurope/europe-ilo-cld-xhaz-sex-age-geo-rt-share-of-children-in-hazardous-work-by-sex-age-and")`即可获取训练集。加载后,数据可转换为Pandas DataFrame进行探索。典型用法包括按国家过滤数据并进行单指标时间序列分析,或通过数据透视表构建国家-年份矩阵,以便于比较各国儿童危险劳动比例的长期趋势。该数据集还支持分类与回归任务,适应多种机器学习工作流。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于1995年至2025年间采集,经Electric Sheep Europe于2025年重新打包并发布在HuggingFace平台上,专注于欧洲14个国家中儿童从事有害劳动的比例,涵盖性别、年龄及城乡维度的细分指标。在劳动经济学与儿童保护研究领域,量化儿童在危险环境中的工作状况是评估可持续发展目标(SDG)第八项体面劳动进展的核心议题。该数据集揭示了欧洲区域内儿童劳动风险的分布特征,为政策制定者、国际组织及学术研究提供了跨时空的可比性证据,尤其对识别高危群体和评估干预措施效果具有重要参考价值。ILO作为全球劳动统计的权威机构,其数据经统一口径(ICLS定义)与多源校验,确保了跨国家、跨年份分析的可靠性,从而推动了关于欧洲儿童劳动问题的实证研究向更精细化的方向演进。
当前挑战
该数据集所面临的挑战首先源于领域问题的复杂性:儿童从事有害劳动的定义标准因国家法律与国际框架(如ILO第182号公约)之间存在差异,导致跨区域比较时存在隐含的异质性偏差。尽管ILOSTAT通过ICLS定义进行调和,但各国调查问卷与执行标准的不一致仍可能引入测量误差。在数据构建过程中,挑战主要体现在样本稀疏性与覆盖不均上:覆盖的14个国家中,乌克兰仅提供2015年数据,白俄罗斯、希腊等国观测值不足50条,而奥地利、瑞士等国则拥有超过100次观测,这种不均衡降低了时间序列预测与多层回归模型的稳健性。此外,数据来源混杂了劳动力调查、住户收入调查及行政记录,不同来源的抽样设计与质量标记(如“不可靠”状态)需要研究者谨慎处理以规避偏差传导。
常用场景
经典使用场景
该数据集基于国际劳工组织ILOSTAT数据库,汇集了欧洲14个国家1995年至2025年间关于儿童从事有害工作的性别、年龄及城乡分布比例,共计1043条观测记录。其经典使用场景主要集中于利用结构化表格数据进行分类与回归分析,例如构建预测模型以识别高危儿童群体,或通过时间序列分析方法追踪欧洲区域童工劳动模式的演变趋势,为跨国比较和纵向研究提供了标准化、可复用的数据基础。
衍生相关工作
该数据集的发布与整理衍生了诸多经典工作方向。一方面,它以Machine-Learning-Ready的格式重新包装权威统计数据,启发了“Electric Sheep Europe”系列项目,推动了欧洲公共数据的统一、可复现的机器学习基准建设。另一方面,围绕ILOSTAT数据源,学术界涌现出大量利用多指示面板数据进行跨国童工风险建模、劳动市场不平等量化以及SDG指标推算的研究。数据集中清晰的来源标注与分类体系,也为后续构建更为精细的儿童福利综合数据集提供了范式与代码基础。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲14国1995至2025年间未成年人从事有害劳动的比例,按性别、年龄及城乡地域进行细化分解,为国际劳工组织ILOSTAT数据库的核心指标之一。当前,围绕全球童工治理与可持续发展目标(SDG 8.7)的推进,该数据集在揭示欧洲地区有害童工劳动的时空演变规律、性别差异及地域不均衡性方面具有前沿研究价值。结合近年来欧盟强化供应链尽职调查立法及社会责任投资浪潮,研究者可借助该高颗粒度时间序列数据,评估政策干预成效、预测风险趋势,并为跨国劳工权益监测与循证决策提供量化支撑。
以上内容由遇见数据集搜集并总结生成



