electricsheepafrica/africa-ilo-cld-xchl-sex-age-stu-rt-share-of-children-in-child-labour-by-sex-age-and-s
收藏数据链接:
官方服务:
资源简介:
该数据集包含关于童工的3,299个观察值,覆盖44个非洲国家,时间跨度为2001年至2025年,涉及1个独特指标:按性别、年龄和上学出勤率划分的童工儿童比例(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过处理和标准化,适用于表格分类、回归和时间序列预测等任务。
This dataset contains 3,299 observations related to child labor, covering 44 African countries with a time span from 2001 to 2025. It includes one unique indicator: the proportion (percentage) of child laborers categorized by gender, age, and school attendance rate. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), and has been processed and standardized for applications such as tabular classification, regression, and time series forecasting tasks.
提供机构:
electricsheepafrica搜集汇总
数据集介绍

构建方式
童工问题作为全球劳动统计领域长期关注的焦点,其监测依赖于高质量、标准化的数据采集体系。该数据集由Electric Sheep Africa团队从ILOSTAT官方REST API直接拉取,原始数据来源于国际劳工组织(ILO)基于国际劳动统计学家会议(ICLS)定义对各国劳动力调查微观数据的统一处理与整合。数据经过过滤,仅保留非洲ISO3国家代码对应的记录,确保地理范围的针对性。最终构建为包含3299条观测值、覆盖44个非洲国家、时间跨度从2001年至2025年的结构化表格数据集。
特点
该数据集的核心特征在于其精细的多维分类体系,以单一指标“按性别、年龄和就学状况划分的童工比例”为核心,提供了性别(男、女、总计)、年龄组以及教育出勤状态等细分维度的观测值。所有数据均为年频,并附有来源标签与观测状态标记,便于追溯数据质量。此外,数据以Parquet格式打包,经由HuggingFace Datasets库发布,实现了机器学习场景下的高度可访问性与即用性。
使用方法
研究人员可通过Python的datasets库执行load_dataset()命令直接加载该数据集,并转换为pandas DataFrame进行后续分析。支持按国家代码筛选特定国家的时间序列数据,或使用pivot_table函数将数据重塑为国家×年份的矩阵形式进行跨区域比较。由于指标单一且结构清晰,用户可快速开展童工比例的描述统计、时序预测或分类建模任务,适配表格分类、回归与时序预测等多种机器学习范式。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Africa重新整理后托管于HuggingFace平台,聚焦非洲44个国家2001至2025年间儿童劳动参与率的性别、年龄与就学状况分布。作为ILOSTAT核心统计数据库的子集,其指标严格遵循国际劳工统计学家会议(ICLS)定义,为监测可持续发展目标中体面劳动与儿童权益进展提供了关键数据支撑。该数据集以3,299条观测记录覆盖了非洲大陆广泛的地域与时间跨度,成为研究区域儿童劳动动态、评估政策干预效果的基础性资源,对发展经济学、劳动社会学及公共政策领域产生了深远影响。
当前挑战
该数据集面临的核心挑战在于:1)儿童劳动议题本身的复杂性——如何从混杂的家庭调查、劳动力调查与行政记录中准确识别符合国际定义的童工活动,特别是在非正规经济占比高的非洲语境下;2)数据构建过程中,各国调查方法、问卷设计及抽样框架的差异导致指标可比性受限,ILO虽通过元数据标记‘最佳来源’与‘序列断裂’进行调和,但跨国家、跨年份的纵向一致性仍需谨慎审视。此外,部分年份与国家的观测稀疏,增大了时间序列建模与区域综合研判的难度。
常用场景
经典使用场景
在非洲童工问题的实证研究中,该数据集常被用于量化分析不同性别、年龄段及入学状态下的童工比例分布特征。研究人员可结合国家层面的社会经济指标(如GDP、教育支出、政策干预强度),构建面板数据模型,探究童工现象的时间演变规律与区域异质性。其高颗粒度的分类维度(如性别细分、教育参与状态)使得研究者能够精准刻画脆弱群体的劳动参与模式,为国际劳工组织(ILO)的可持续发展目标(SDG8.7)监测提供数据支撑。
解决学术问题
该数据集有效填补了非洲大陆童工统计的长期数据空白,解决了因跨国调查标准不一而导致的可比性缺失问题。通过ILOSTAT统一方法论框架下的标准化指标,学者能够突破单一国家案例研究的局限性,开展跨区域比较分析,揭示童工现象与贫困陷阱、教育排斥、性别不平等之间的复杂因果关联。其长达24年的时序数据为政策评估提供了关键证据基础,推动了关于义务教育立法效果、劳动监察能力建设等议题的实证研究深化。
衍生相关工作
该数据集衍生了一系列代表性研究,包括基于广义线性混合模型(GLMM)的非洲童工空间集聚效应分析,以及结合联合国人口预测数据构建的童工规模预警系统。有学者利用其中的教育分类字段,验证了‘童工-辍学恶性循环’理论在撒哈拉以南非洲的适用性,并因此发展了针对流动儿童群体的修正理论框架。此外,该数据与ILO其他劳动统计指标(如失业率、非正规就业占比)的联合分析,催生了关于童工现象与劳动力市场结构转型关系的多篇政策简报。
以上内容由遇见数据集搜集并总结生成



