遇见数据集

electricsheepasia/asia-ilo-cld-xgpb-sex-age-stu-nb-children-in-child-labour-general-production-bounda

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲10个国家(如阿富汗、孟加拉国、也门等)在2019年至2023年间的童工数据,共有332个观测值。核心指标为CLD_XGPB_SEX_AGE_STU_NB,表示按性别、年龄和上学情况划分的童工儿童数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过过滤和标准化处理,覆盖了国家代码、数据来源、指标、性别(总计、男性、女性)、年龄分类、上学情况分类、观测年份、观测值及数据状态等信息。数据集旨在提供亚洲地区童工情况的标准化、机器学习就绪的数据,适用于表格分类、回归或时间序列预测等任务。

This dataset contains 332 observations of child labour data across 10 Asia countries (e.g., Afghanistan, Bangladesh, Yemen) spanning 2019–2023. The primary indicator is CLD_XGPB_SEX_AGE_STU_NB, which represents Children in child labour -- General Production Boundary by sex, age and school attendance status (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asian countries, with harmonization based on ICLS definitions. It includes columns such as country codes, source information, indicator codes, sex disaggregation (total, male, female), age classification, school attendance classification, observation year, observed values, and data quality flags. The dataset is designed as a standardized, ML-ready resource for tabular classification, regression, or time-series forecasting tasks related to child labour in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xgpb-sex-age-stu-nb-children-in-child-labour-general-production-bounda 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,聚焦于亚洲地区童工劳动现象。数据通过调用ILOSTAT REST API,从原始指标代码CLD_XGPB_SEX_AGE_STU_NB中提取,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,每个观测值均附带来源标签(source.label)以确保可追溯性。数据集由Electric Sheep Asia团队重新打包为HuggingFace格式,涵盖2019至2023年间10个亚洲国家的332条观测记录。
特点
该数据集的核心特点在于其多维度的精细分层架构。除时间维度和国家维度外,数据按性别(总、男、女)、年龄组(5-17岁)以及入学状况进行交叉分类,提供丰富的离散化视角。所有观测值均遵循一般生产边界(General Production Boundary)定义,以千人为单位量化童工数量。数据质量方面,ILOSTAT自动为每个国家-年份组合选取最佳来源,并标注观测状态(如不可靠)及序列中断等注释信息,便于用户评估数据可信度。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,调用load_dataset()函数即可获取包含所有列结构的表格。典型应用场景包括:按国家筛选子集进行国别分析;针对单一指标按时间排序后绘制趋势图;利用pandas的pivot_table功能构建国家×年份矩阵,便于跨区域对比。数据以Parquet格式存储,支持高效的列式操作,适合与Python数据分析生态(如pandas、matplotlib)无缝衔接。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2023年发布,经Electric Sheep Asia重新整理后托管于HuggingFace平台,聚焦亚洲地区童工劳动问题。其核心研究问题在于量化10个亚洲国家(如阿富汗、孟加拉国、也门等)2019至2023年间,按性别、年龄及就学状态划分的童工人数(基于通用生产边界定义)。作为ILOSTAT数据库的衍生品,该数据集依托ILO权威的劳动力统计标准和家庭调查数据,为区域童工治理提供了稀缺的细粒度时间序列参照。它的问世填补了亚洲跨国童工数据整合的空白,助力可持续发展目标(SDG)中体面劳动指标的监测,对发展经济学、劳动社会学及政策评估领域产生了重要影响。
当前挑战
该数据集首先面临领域问题层面的挑战:童工现象涉及文化敏感性、地下经济活动及家庭隐瞒,导致官方调查通常低估真实规模;数据诠释高度依赖“通用生产边界”定义,不同国家对童工年龄阈值和劳动类型的界定存在差异,削弱了跨国可比性。在构建过程中,挑战更为具体:原始数据来源于各国劳动力调查,调查年份严重不均衡(如马尔代夫仅2019年、乌兹别克斯坦仅2021年),且观测总量仅332条,稀疏样本难以支撑稳健的时间序列建模;部分观测值被标记为“不可靠”(obs_status=U),如阿富汗2023年数据存在方法论断裂,引入额外不确定性;此外,分类维度的空值处理与跨来源数据融合(如“最佳来源”选择策略)亦对数据质量一致性构成考验。
常用场景
经典使用场景
在劳动力统计与国际发展研究领域,该数据集承载了亚洲地区童工现象的量化分析使命。其经典应用场景聚焦于按性别、年龄与就学状态三个核心维度,对广义生产边界下的童工人数进行分层统计,从而揭示亚洲不同国家在消除童工劳动方面的进展与差异。研究人员常借助该数据集开展跨国比较分析,结合年份序列数据,追踪2019至2023年间各国童工规模的动态演变,为政策评估与可持续发展目标(SDG)监测提供实证基础。
衍生相关工作
该数据集衍生出一系列聚焦亚洲童工问题的经典研究工作,涵盖跨国回归分析、时序预测模型与社会指标综合评估。研究者基于其对性别与教育维度的细致刻画,开发了评估童工脆弱性指数的方法框架,部分工作进一步结合ILOSTAT其他指标如家庭收入与就业结构,构建了多因素影响路径模型。另有学者利用该数据训练轻量级分类模型,实现对未知国家童工状况的初步推断,推动了数据稀缺区域分析方法的创新,巩固了ILOSTAT作为劳工统计权威来源的学术影响。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区儿童劳工现象的量化分析,通过整合国际劳工组织ILOSTAT的权威统计指标,揭示了2019至2023年间十个亚洲国家中儿童从事经济活动的规模与特征。其前沿研究价值在于通过性别、年龄与就学状态的多维交叉分类,为评估儿童劳工普遍生产边界的动态演变提供了结构化数据支撑。当前全球可持续发展目标(SDGs)对体面劳动与消除童工现象的关注日益攀升,该数据集的出现恰逢其时,它使得研究者能够利用时间序列与面板数据进行深度建模,追踪经济政策干预与教育普及对童工比例的潜在影响。同时,其标准化的元数据架构与以国家-年份为轴的矩阵化操作能力,极大地方便了跨区域比较分析与因果推断,为遏制亚洲贫困与童工恶性循环提供了统计学上的实证基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务