遇见数据集

electricsheepeurope/europe-ilo-cld-xchl-sex-age-geo-rt-share-of-children-in-child-labour-by-sex-age-and-a

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1995年至2025年间17个欧洲国家关于童工的1,141个观测值,核心指标为按性别、年龄和城乡地区划分的童工儿童比例(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过欧洲国家过滤。数据集采用表格格式,包含国家代码、指标代码、性别分类、年龄分类、城乡地区分类、年份、观测值及数据质量标志等字段。数据覆盖奥地利、瑞士、匈牙利、罗马尼亚、爱沙尼亚、俄罗斯、马耳他、摩尔多瓦、北马其顿、塞尔维亚、乌克兰、法国、斯洛文尼亚、波兰、白俄罗斯等国家,旨在提供欧洲童工情况的标准化、机器学习就绪的数据,用于分类、回归或时间序列预测等任务。

This dataset contains 1,141 observations on child labor across 17 European countries covering the period from 1995 to 2025. The core indicator is the percentage (%) of children engaged in child labor, categorized by gender, age group, and urban-rural region. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to include only data from European countries. The dataset is formatted as a tabular structure, with fields including country code, indicator code, gender category, age category, urban-rural region category, year, observed value, and data quality flag. The covered countries are Austria, Switzerland, Hungary, Romania, Estonia, Russia, Malta, Moldova, North Macedonia, Serbia, Ukraine, France, Slovenia, Poland, and Belarus. This dataset aims to provide standardized, machine learning-ready data on child labor conditions in Europe for tasks such as classification, regression, or time series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-cld-xchl-sex-age-geo-rt-share-of-children-in-child-labour-by-sex-age-and-a 数据集图片
构建方式
该数据集由Electric Sheep Europe基于国际劳工组织(ILO)的ILOSTAT数据库重新整理而成。数据通过ILOSTAT REST API直接获取,特定指标为儿童劳动参与率(按性别、年龄及城乡区域划分)。数据过滤仅保留欧洲国家,涵盖1995年至2025年间的年度观测,共1,141条记录,涉及17个欧洲国家。每条观测包含国家代码、数据来源、指标类型、性别、年龄组、地理分类、观测年份及数值等字段,并保留来源标记以确保可追溯性。
特点
数据集聚焦于欧洲17国的儿童劳动参与率,按性别(男性、女性、总计)、年龄段(如15-17岁)以及城乡区域(国家、城市、农村)进行细致分层。数据来源多样化,包括劳动力调查、家庭收入调查及行政记录,并由ILO根据国际劳动统计学家会议定义进行统一协调。数据标注了观测状态(如不可靠或临时数据),便于用户评估质量。年度频率使其适用于时间序列分析与跨国比较。
使用方法
用户可以通过HuggingFace Datasets库直接加载数据集,使用`load_dataset`函数即可获取。加载后可将数据转换为Pandas DataFrame进行探索。典型应用包括:按国家筛选数据以进行国别分析,按时间排序绘制时间序列图,或通过数据透视表构建国家×年份矩阵以进行跨时段横向对比。该数据集也适用于表格分类、回归及时间序列预测等机器学习任务。
背景与挑战
背景概述
童工问题作为全球劳动力市场中的严峻挑战,长期受到国际社会的广泛关注。自1995年至2025年间,国际劳工组织(ILO)通过其ILOSTAT统计数据库系统性地收集了欧洲17个国家的童工数据,并由Electric Sheep Europe团队以标准化格式重新封装为该数据集。该数据集聚焦于按性别、年龄及城乡地域划分的童工占比这一核心指标,旨在为研究欧洲地区童工现象的时空演变规律提供高质量、可交互的数据基础。其发布为劳动经济学、社会政策分析及可持续发展目标监测等领域的研究者提供了宝贵的纵向数据资源,推动了基于证据的政策制定与学术探索。
当前挑战
该数据集所应对的核心领域挑战在于:童工率的准确定量与跨国比较长期受制于各国调查方法、统计标准及数据质量的显著差异,导致全球童工规模的估算存在较大不确定性。在构建过程中,数据集面临的挑战包括:ILOSTAT原始数据来源多样,需整合来自劳动力调查、家庭收入调查及行政记录等多源异构数据,并依赖ILO的统计专家进行复杂的清洗与标准化处理;同时,部分国家或年份的数据存在缺失、不可靠或来源不统一的问题,需通过‘最优来源’选择策略与观测状态标记来平衡数据可用性与准确性,确保纵向分析的可信度。
常用场景
经典使用场景
该数据集记录了欧洲17个国家在1995至2025年间儿童劳动参与率的年度观测值,涵盖性别、年龄及城乡地域的精细分组。其经典使用场景在于利用时间序列与面板数据结构,分析欧洲区域内童工现象的长期演变趋势,并通过分组比较揭示不同性别、年龄群体以及城乡地区之间的差异性模式。研究者可基于此数据构建线性回归或面板数据模型,识别人口结构、经济发展阶段与童工比例之间的统计关联,为区域劳动经济学研究提供定量支撑。
解决学术问题
该数据集系统性地回应了劳动经济学与社会政策研究中关于童工现象定量描述不足的学术困境。借助ILOSTAT统一协调的调查指标,它解决了跨国比较中数据口径不一、断代缺失以及细分维度不足的核心难题,使学者得以在控制国家与年份固定效应的条件下,严谨评估欧盟社会政策、国家教育普及程度或收入转移方案对童工比例的实际影响。该数据集为研究人力资本代际传递、儿童权益保障与可持续发展目标(SDG 8.7)的进展监测提供了可靠的数据基础,推动了区域层面童工治理实证研究的深化。
衍生相关工作
该数据集启发了多项衍生研究工作,涵盖基于机器学习的童工风险预测模型、社会指标与经济发展变量之间的因果推断分析,以及跨数据集融合研究。例如,研究者将其与欧洲各国的教育支出、家庭收入分布或社会保障覆盖数据联合使用,构建多维度面板数据库以深入剖析童工现象背后的结构性驱动因素。此外,该数据集可作为基准之一用于检验和比较各类统计或深度学习方法在稀有时间序列预测任务上的表现,促进了劳动统计领域数据科学方法的迭代与开发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务