electricsheepafrica/africa-ilo-cld-xgpb-sex-age-ste-nb-children-in-child-labour-general-production-bounda
收藏数据链接:
官方服务:
资源简介:
该数据集包含880个观察值,涉及14个非洲国家的童工数据,时间跨度为2009年至2024年,覆盖1个不同的指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,这是一个全球领先的劳动统计来源,涵盖就业、失业、工资、工作时间、童工等领域。数据集经过处理和过滤,专注于非洲地区,并提供了按性别、年龄和就业状况分类的童工统计数据。
This dataset contains 880 observations of child labour data across 14 Africa countries, spanning 2009–2024, covering 1 distinct indicators. The data is sourced from ILOSTAT, the ILOs central statistics database, which is a leading global source for labour statistics, including employment, unemployment, wages, working time, child labour, and more. The dataset is filtered to Africa and includes disaggregated data by sex, age, and status in employment.
提供机构:
electricsheepafrica搜集汇总
数据集介绍

构建方式
该数据集由Electric Sheep Africa团队依据ILOSTAT官方API获取原始数据,并针对非洲地区ISO3国家代码进行筛选与重构。ILOSTAT作为国际劳工组织(ILO)的核心统计数据库,通过对各国劳动力调查、家庭收支调查及行政记录等微数据的标准化处理,采用国际劳工统计学家会议(ICLS)定义进行数据清洗与对齐。最终数据集包含来自14个非洲国家的880条观测记录,时间跨度覆盖2009年至2024年,聚焦于童工劳动领域的一项核心指标。
特点
数据集以精细化的多维分类体系见长,包含性别(总、男、女)、年龄(5-17岁)以及就业身份(ICSE-93分类)等维度,为研究者提供灵活的切片分析能力。所有观测值均附带数据源标签、观测状态标识(如可靠性标记)及注释字段,便于追踪数据质量与修订历史。此外,数据以年度频率呈现,并采用ILO优先选取的‘最佳来源’策略处理同国家同年的多源冲突,确保统计口径的一致性。
使用方法
用户可通过HuggingFace的`datasets`库直接加载数据集,利用`load_dataset()`函数快速获取Pandas DataFrame格式的数据。典型应用包括按国家代码筛选单一国家的时间序列分析、按指标代码排序后绘制趋势图,或通过透视表构建国家×年份的矩阵以进行横向比较。数据集适用于表格分类、回归及时间序列预测任务,其标准化的列结构和Parquet格式便于与机器学习工作流无缝集成。
背景与挑战
背景概述
童工现象是全球劳动市场中的一项严峻挑战,尤其在非洲地区,由于经济脆弱性与教育体系薄弱,大量儿童被迫从事经济活动,严重威胁其身心健康与发展权利。国际劳工组织(ILO)作为劳动统计领域的权威机构,其下设的ILOSTAT数据库系统性地整合了全球劳动力调查数据,为政策制定与学术研究提供了坚实基础。在此背景下,Electric Sheep Africa团队于2024年基于ILOSTAT数据源,重新封装并发布了涵盖2009至2024年间14个非洲国家、共880条观测值的童工数据集。该数据集聚焦于按性别、年龄与就业身份划分的一般生产边界内童工人数,旨在为非洲童工现象的量化分析与干预策略提供标准化、可复用的机器学习就绪数据资源,推动区域可持续发展目标(SDG)中关于消除童工议题的研究进程。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:童工现象的界定依赖于国际劳工统计学家会议(ICLS)定义,而各国调查工具与统计口径存在显著差异,导致跨国家、跨时期的可比性不足。此外,数据集仅覆盖14个非洲国家,大量童工问题严重的区域因数据缺失而无法纳入分析,样本稀疏性限制了模型泛化能力。在构建过程中,数据来源于多源的国家劳动力调查、家庭收支调查等,各源数据的质量参差不齐,部分观测值被标记为“不可靠”(U),且存在因方法论修订导致的序列中断问题。数据时间跨度虽长,但分布极不均匀,如博茨瓦纳仅有一年数据,而赞比亚则占据近三分之一的观测值,这种非平衡性给时间序列预测任务带来了显著偏误风险。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中非洲14个国家2009至2024年间童工现象的权威统计资料,涵盖性别、年龄及就业身份等关键维度。研究者可通过其结构化表格数据开展多维度交叉分析,例如利用时间序列追踪特定国家童工数量的演变轨迹,或借助分类特征探索不同性别与年龄段群体的劳动参与差异。该数据集设计简洁,包含880条观测记录,便于快速加载与处理,尤其适合作为非洲劳动经济学与儿童权利保护领域研究的起点。
解决学术问题
该数据集直接回应了非洲童工问题研究中长期存在的数据碎片化与可比性不足的困境。通过统一遵循国际劳工统计学家会议(ICLS)定义标准,它实现了跨国界、跨年份的规范统计,使学者能够系统评估非洲地区童工现象的规模与结构特征。这有助于揭示童工与贫困、教育缺失、性别不平等之间的关联机制,为验证劳动经济学中的家庭决策模型、人力资本投资理论提供了稀缺的经验证据,并促进了可持续发展目标(SDG 8.7)下消除童工议题的量化分析。
衍生相关工作
该数据集已引发一系列衍生研究,其标准化结构常被整合进非洲社会指标综合数据库中,作为童工模块的核心组成部分。经典的后续工作包括利用其时间维度建立面板数据模型,分析童工率与宏观经济冲击的因果效应;或者通过性别分层的观测值,检验童工在家庭决策中的劳动替代弹性。一些研究将其与国家层面的性别发展指数(GDI)耦合,探究性别不平等对童工分布的内在影响。这些工作不仅拓展了劳动经济学的分析边界,也为ILOSTAT数据体系与其他非洲专题数据集的联合分析奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成



