遇见数据集

electricsheepasia/asia-ilo-cld-xgpb-sex-age-stu-rt-share-of-children-in-child-labour-general-producti

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是关于亚洲地区儿童童工占比的统计数据集,由国际劳工组织(ILO)的ILOSTAT数据库提供,并由Electric Sheep Asia重新打包发布。数据集包含1960个观测值,覆盖32个亚洲国家,时间跨度为1996年至2025年,重点关注一个核心指标:CLD_XGPB_SEX_AGE_STU_RT,即按性别、年龄和上学情况划分的通用生产边界下的儿童童工占比(百分比)。数据通过ILOSTAT REST API直接获取,并过滤为亚洲国家代码,经过ILO的统计部门根据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集以表格形式呈现,包含多个列,如国家代码(ref_area)、国家名称(ref_area.label)、数据来源(source.label)、指标代码(indicator)、性别分类(sex)、年龄和上学情况分类(classif1和classif2)、观测年份(time)、观测值(obs_value)以及数据状态标志(obs_status)等。数据支持按性别(总休、男性、女性)、年龄和上学情况进行细分,并包含数据质量说明,例如数据为年度频率,ILO选择最佳来源处理多源数据。该数据集适用于表格分类、回归和时间序列预测等任务,可用于研究亚洲儿童童工趋势、政策分析和机器学习建模。

This dataset contains statistical data on the share of children in child labour in Asia, sourced from the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Asia. It includes 1,960 observations across 32 Asian countries, spanning from 1996 to 2025, with a focus on one key indicator: CLD_XGPB_SEX_AGE_STU_RT, which represents the share of children in child labour under the General Production Boundary, disaggregated by sex, age, and school attendance (%). Data is pulled directly from the ILOSTAT REST API, filtered to Asian country codes, and harmonized by the ILOs Department of Statistics using International Conference of Labour Statisticians (ICLS) definitions. The dataset is presented in tabular format with columns such as country code (ref_area), country name (ref_area.label), data source (source.label), indicator code (indicator), sex disaggregation (sex), age and school attendance classifications (classif1 and classif2), observation year (time), observed value (obs_value), and observation status flags (obs_status). It supports disaggregation by sex (total, male, female), age, and school attendance, and includes data quality caveats, such as annual frequency and the use of ILO-selected best source for multiple sources. This dataset is suitable for tasks like tabular classification, regression, and time-series forecasting, and can be used for research on child labour trends in Asia, policy analysis, and machine learning modeling.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xgpb-sex-age-stu-rt-share-of-children-in-child-labour-general-producti 数据集图片
构建方式
本数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦亚洲地区童工现象的量化表征。数据通过调用ILOSTAT REST API接口,提取指标代码为CLD_XGPB_SEX_AGE_STU_RT的原始数据,并依据ISO 3166-1 alpha-3标准筛选出32个亚洲国家的观测记录。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行统一协调与标准化处理,确保跨国可比性。数据集共收录1960条观测值,时间跨度覆盖1996年至2025年,所有数据均以cc-by-4.0许可协议开放。
特点
该数据集最具特色之处在于其精细的多维分组设计。除核心指标'按性别、年龄和就学状态划分的一般生产边界内童工儿童占比'外,还通过sex、classif1和classif2等分类变量,实现按性别(总/男性/女性)、年龄组及教育出勤状况的交叉细分。每个观测值均附带详尽的元数据标签,包括数据来源标识(source.label)、观测状态标志(obs_status)及序列断裂等说明性注释(note_indicator.label),极大提升了数据的可追溯性与科研诚信度。
使用方法
使用者可通过HuggingFace生态的datasets库实现无缝加载,仅需一行`load_dataset()`命令即可将数据转换为Pandas DataFrame格式进行深度分析。针对国家维度的子集筛选,可通过`ref_area`列按ISO代码快速提取;针对单一指标的时间序列分析,推荐按`time`列排序后直接绘图。对于截面研究,建议采用pivot_table函数将数据重构为国家×年份的矩阵形式,便于进行跨国家比较或面板数据分析。数据框内所有列名均保持ILOSTAT原始命名规范,确保与官方文档的无缝对接。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT统计数据库构建,经Electric Sheep Asia重新打包后于2025年发布,聚焦于亚洲32个国家中5至17岁儿童从事童工劳动的普遍性。核心研究问题在于量化性别、年龄及就学状态对童工参与率的影响,以揭示劳动力市场中儿童权益保护的脆弱环节。作为ILO推动体面劳动与可持续发展目标(SDG 8.7)的重要数据工具,该数据集提供了1996至2025年间跨越近三十年的时序观测,为亚洲区域童工问题的跨国比较与政策评估奠定了坚实基础。
当前挑战
童工现象的隐匿性与数据采集的困难构成了核心领域挑战:许多童工活动游离于正规统计体系之外,导致调查结果对隐性劳动形式覆盖不足,难以全面反映真实规模。数据集构建中面临多重技术难点,包括各国调查方法、指标定义及统计口径的差异——ILO需通过国际劳工统计学家会议(ICLS)框架对原始调查微观数据进行协调与标准化,同时处理因调查来源更替引发的序列断裂问题。此外,少量国家因数据源不稳定而出现观测状态标记为“不可靠”,削弱了时序分析的连续性与精确度。
常用场景
经典使用场景
在儿童劳动研究的学术版图中,'Asia ILO Child Labour Share Dataset'作为国际劳工组织ILOSTAT数据库的亚洲子集,为分析亚洲32国儿童劳动参与率提供了标准化、可复现的数据基础。该数据集聚焦'按性别、年龄与就学状态划分的儿童劳动份额'这一核心指标,跨越1996至2025年,形成近2000条观测记录。研究者可借助其多维分类变量,系统考察不同人口学特征下儿童劳动现象的时空差异,从而构建回归模型或面板数据分析,探究经济发展、教育普及与童工现象之间的深层关联。
解决学术问题
数据集直指发展经济学与劳动经济学中的关键议题——如何量化并解释亚洲地区儿童劳动现象的演变规律。通过提供按性别、年龄、就学状态精细分层的标准化数据,它解决了因各国统计口径不一而无法进行跨国比较的学术困境。研究者可据此验证制度变迁、教育扩张与童工比例下降之间的因果关系,揭示性别不平等对女孩劳动参与率的特殊影响,以及入学状态如何调节儿童进入劳动市场的风险。其意义在于为SDG目标8.7的监测提供实证基础,推动从描述性统计到因果推断的范式跃迁。
衍生相关工作
该数据集衍生出一系列重要的学术与政策研究成果。经典工作包括基于面板数据模型对亚洲童工决定因素的系统分析,证实家庭经济冲击与教育可及性是驱动儿童劳动的核心变量。另有学者利用其性别分列特征,探讨父权文化背景下女孩劳动强度与就学率的非线性关系,拓展了女性主义经济学对再生产劳动的理论讨论。在方法论层面,该数据集催生了针对ILO统计口径的效度检验研究,以及将不同年份、不同来源的微观调查数据与宏观指标进行整合的调和算法,为后续劳动统计数据库的标准化建设提供了参照基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务