遇见数据集

electricsheepafrica/africa-ilo-cld-xgpb-sex-age-geo-rt-share-of-children-in-child-labour-general-producti

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是关于非洲儿童劳动情况的统计数据集,具体聚焦于按性别、年龄和城乡划分的通用生产边界下儿童劳动参与比例。它包含3,056个观察值,覆盖43个非洲国家,时间范围为2001年至2025年。数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过过滤以仅包含非洲国家数据。数据包括儿童劳动比例的指标,并按照性别、年龄和城乡区域进行细分。数据模式包括国家代码、来源、指标代码、分类变量、年份和观察值等列。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究者和开发者提供机器学习就绪的数据,以分析非洲儿童劳动趋势。

This dataset contains statistical data on child labour in Africa, specifically focusing on the Share of children in child labour -- General Production Boundary by sex, age and rural/urban areas. It includes 3,056 observations across 43 African countries, spanning from 2001 to 2025. The data is sourced from ILOSTAT, the International Labour Organizations (ILO) central statistics database, retrieved via REST API and filtered to African ISO3 country codes. The dataset features a single indicator on child labour proportions, disaggregated by sex, age, and rural/urban dimensions. The schema includes columns such as country codes, source information, indicator codes, classification variables, year, and observed values. It is designed for tabular classification, regression, and time-series forecasting tasks, providing a machine learning-ready resource for analyzing child labour trends in Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-cld-xgpb-sex-age-geo-rt-share-of-children-in-child-labour-general-producti 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦非洲地区童工劳动参与率这一核心社会议题。数据通过ILOSTAT REST API直接抓取,筛选出非洲43个国家的ISO3代码,最终汇聚成包含3,056条观测值的时间序列数据集。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行统一 harmonisation,并标注数据来源以保证可追溯性。数据集的构建过程强调标准化与可复现性,由Electric Sheep Africa重新打包为兼容HuggingFace Datasets格式的Parquet文件,便于机器学习流水线直接调用。
特点
数据集涵盖2001年至2025年间非洲43个国家的童工劳动比例指标(CLD_XGPB_SEX_AGE_GEO_RT),按性别、年龄及城乡地域进行细致拆分。其结构包含多维分类变量,如性别(总、男、女)、年龄组(如15-17岁)及地理覆盖范围(国家级),支持多层次聚合分析。数据质量方面,仅采用ILO筛选的“最佳来源”数据,并标注了序列中断等异常状态标识,确保研究者能准确评估数据可靠性。所有观测值均为年度频率,经过严格 harmonisation 流程,兼具地域广度与时间深度。
使用方法
通过HuggingFace Datasets库可直接加载该数据集,调用`load_dataset()`函数后即可转换为Pandas DataFrame进行探索性分析。用户可依据`ref_area`列筛选特定国家的数据子集,或对`indicator`列过滤单一指标以构建时间序列模型。为进行跨国家对比,建议使用`pivot_table`方法将数据重塑为国家×年份的矩阵形式。数据集原生支持表格分类、回归及时间序列预测任务,适合用于描绘非洲童工劳动趋势的计量经济学研究或社会政策评估中的基准测试。
背景与挑战
背景概述
童工问题作为全球劳动市场中的痼疾,长久以来因数据稀疏与统计口径不一而难以精准刻画。为此,国际劳工组织(ILO)依托其统计数据库ILOSTAT,构建了名为“按性别、年龄和城乡分组的总体生产边界内童工占比(非洲)”的数据集。该数据集汇聚了来自43个非洲国家、横跨2001年至2025年间的3,056条观测记录,统一采用国际劳工统计学家会议(ICLS)定义的童工标准,将各国零散的劳动力调查、家计调查等微观数据加以整合与协调。数据集由Electric Sheep Africa团队于2025年打包并发布在HuggingFace平台,其核心研究问题聚焦于精确量化非洲地区童工现象的分布规模与动态演变。通过提供标准化的时间序列与多维度细分指标,该数据集为跨国比较、政策评估及可持续发展目标(SDG)的监测提供了坚实的实证基础,显著提升了非洲童工数据的可及性与可比性,对发展经济学与劳动社会学领域产生了深远影响。
当前挑战
数据集所解决的领域问题在于,非洲童工现象长期缺乏跨国家、跨时段的统一量化指标,既往研究多依赖破碎的个案或单一国家报告,难以揭示区域性与系统性规律。该数据集通过构建结构化面板数据,使得研究者能够跨越国界与年代,系统分析童工比例的性别差异、年龄分层与城乡鸿沟。然而,构建过程本身亦面临严峻挑战:首先,各国原始调查的抽样框架、问卷设计与执行年份各异,ILO需反复应用ICLS定义进行数据协调与标识,以保证“最佳来源”选择的合理性;其次,数据中频繁出现系列中断与状态变更(如`obs_status`字段中的`Break in series`),反映了经济波动、调查更替或政策调整带来的统计连续性断裂;再者,部分国家(如苏丹、索马里等)数据缺失显著,且数据集仅收录ILO筛选后的年度频率指标,排除了月度或季度序列,这限制了高频分析与缺漏值插补的应用空间。这些挑战提示使用者需谨慎处理标识噪声与样本选择偏误,充分运用元数据中的来源标注与备注信息进行稳健性建模。
常用场景
经典使用场景
该数据集作为国际劳工组织ILOSTAT数据库的非洲子集,聚焦于按性别、年龄及城乡地理划分的童工发生率指标。研究者可将其用于面板数据分析,探讨非洲43个国家在2001至2025年间童工现象的时空演变规律。通过时间序列回归与固定效应模型,能够量化童工比例与宏观经济变量、教育普及率及政策干预之间的动态关联。数据按性别和年龄层次细分,为评估不同群体童工风险的差异化特征提供了精细化的分析基础。
解决学术问题
该数据集有效回应了发展经济学与劳动经济学中关于童工成因与治理效率的核心学术问题。它突破了过往研究中因数据稀缺而难以进行跨国比较的瓶颈,使得研究者能够系统检验童工发生率与贫困陷阱、劳动力市场制度、社会保障覆盖等结构性因素的因果关系。借助该数据,学者可评估千年发展目标及体面劳动议程在非洲地区的实际成效,揭示政策干预在不同性别和城乡维度下的异质性影响,从而为理论模型提供实证支撑。
衍生相关工作
围绕该数据集,学界已衍生出多项具有影响力的研究工作。一方面,基于ILOSTAT统一框架的童工数据被广泛用于构建非洲地区的多维贫困与劳动脆弱性指数,推动了童工研究与儿童福利、家庭经济韧性的跨学科融合。另一方面,研究者利用该数据的时空结构发展了预测非洲童工热点的机器学习模型,通过集成面板回归与时空聚类算法,为事前预警提供了方法论基础。此外,部分工作将该数据与教育统计、冲突事件数据库联动,揭示了武装冲突如何加剧童工风险的传导机制,丰富了冲突经济学与人力资本理论的研究图景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务