遇见数据集

electricsheepeurope/europe-ilo-cld-xchl-sex-age-geo-nb-children-in-child-labour-by-sex-age-and-rural-urba

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲17个国家从1995年至2025年的童工数据,共1,150个观测值,重点关注按性别、年龄和城乡地区分类的童工数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过过滤和标准化处理。数据集包含多个字段,如国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、地区类型、观测年份、观测值等,并提供了数据质量说明和使用示例,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 1,150 observations of child labour data across 17 European countries, spanning from 1995 to 2025, focusing on children in child labour disaggregated by sex, age, and rural/urban areas (in thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for European countries. It includes multiple dimensions such as country codes, country names, data sources, indicator codes, sex classification, age classification, area type, observation year, observed values, and more, with data quality notes and usage examples, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-cld-xchl-sex-age-geo-nb-children-in-child-labour-by-sex-age-and-rural-urba 数据集图片
构建方式
该数据集源自ILOSTAT数据库,通过REST API接口直接拉取指标CLD_XCHL_SEX_AGE_GEO_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围过滤。ILOSTAT依据国际劳工统计学家会议的统一定义,对各国劳动力调查、家计调查等微观数据进行标准化处理,确保跨国可比性。数据集中每个观测值均标注了来源标签,便于追溯原始调查类型。Electric Sheep Europe团队对数据进行重新打包,转换为统一的Parquet格式,并上传至HuggingFace平台,以支持高效的机器学习工作流。
特点
该数据集涵盖1995年至2025年间17个欧洲国家共计1150条观测记录,聚焦于童工数量的性别、年龄及城乡地域细分。数据以年为单位,包含性别(总、男性、女性)和分类变量(如年龄组、地理覆盖范围)等多维度拆解,每条记录均附有观测状态标志以指示数据质量(如临时性或不可靠性)。数据集仅收录ILO选定的最佳来源,避免了多源重复,确保了数据的一致性与权威性。
使用方法
用户可通过HuggingFace的datasets库直接加载数据,调用load_dataset函数即可获得Pandas DataFrame格式的训练集。支持按国家代码筛选特定国家的时间序列数据,也可对特定指标按年份排序后绘制趋势图。进一步地,用户可利用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或跨国家比较。数据列设计清晰,包含标准化代码与英文标签双重标识,便于快速理解字段含义并进行下游建模任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于其核心统计数据库ILOSTAT中编制,并由Electric Sheep Europe于2025年重新打包发布,聚焦于欧洲17个国家1995至2025年间儿童童工状况的量化数据。核心研究问题在于揭示不同性别、年龄及城乡区域的儿童劳动参与模式,为全球劳动力市场与可持续发展目标(SDG)中体面工作指标提供实证基础。作为ILO在劳动统计领域权威数据体系的一部分,该数据集对评估欧洲区域童工现象演变、推动政策制定与国际比较研究具有重要影响力,尤其填补了欧洲层面长期、标准化童工微观数据的大规模可用性空白。
当前挑战
该数据集所面临的领域问题挑战主要在于童工现象的隐蔽性与统计测量的复杂性,需通过性别、年龄及城乡多维分解精准刻画受影响的儿童群体,同时应对跨国数据口径与采集标准差异带来的可比性难题。构建过程中挑战显著,包括需从ILOSTAT REST API中筛选并整合17个国家跨越30年的稀疏观测数据(总计仅1,150条记录),处理各国不同劳动力调查与行政记录来源的异质性,以及应对部分观测值标注为‘不可靠’或‘临时性’所反映的数据质量问题,确保最终数据集的可用性与统计严谨性。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中关于欧洲17个国家童工现象的权威统计资料,时间跨度覆盖1995年至2025年,提供了按性别、年龄以及城乡地域细分的童工数量(以千人为单位)。在学术研究与政策分析领域,它常被用于构建面板数据模型,以追踪欧洲各国童工规模的长期演变趋势,或结合社会经济指标(如GDP、教育投入)探究童工现象的驱动因素与消减路径,是劳动经济学、发展社会学及儿童保护研究中不可或缺的量化基石。
解决学术问题
在学术研究层面,该数据集有效回应了多个关键问题。它使得研究者能够实证检验国际劳工标准在区域层面的落地效果,例如分析特定国家在特定时期童工比率是否显著下降,以及不同性别和年龄组之间的差异性。同时,通过城乡维度的对比,为探究城镇化进程中童工现象的演变特征提供了依据。这一数据资源有力支撑了关于经济增长、教育覆盖与社会保护政策对童工行为影响的因果推断,深化了学术界对消除童工现象内在机制的理解。
衍生相关工作
围绕这一数据资源,已衍生出多项具有影响力的工作。国际劳工组织基于类似数据定期发布全球童工趋势报告,成为国际社会衡量儿童保护现状的基准。在学术界,学者们利用该数据开展跨国比较分析,结合世界银行等来源构建综合模型,探讨家庭贫困、教育可及性与童工现象之间的复杂关联。此外,来自数据科学领域的工作者基于此数据集开发了时间序列预测工具与交互式可视化仪表盘,进一步提升了其可及性与分析效能,推动了劳动统计数据的开放科学运动。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务