遇见数据集

electricsheepasia/asia-ilo-cld-xgpb-sex-age-geo-nb-children-in-child-labour-general-production-bounda

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲9个国家在2020年至2023年期间的儿童劳动数据,共有302个观测值,覆盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涉及儿童劳动——按性别、年龄和城乡地区划分的一般生产边界(以千计)。数据集包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、年龄分类、地区类型、观测年份、观测值、观测状态等字段,用于分析儿童劳动的趋势和模式。

This dataset contains 302 observations of child labour data across 9 Asia countries, spanning 2020–2023, covering 1 distinct indicator. It is sourced from the International Labour Organizations (ILO) ILOSTAT database and focuses on children in child labour -- General Production Boundary by sex, age and rural/urban areas (in thousands). The dataset includes fields such as country codes, country names, data sources, indicator codes, indicator labels, sex disaggregation, age classifications, area types, observation years, observed values, and observation status, enabling analysis of child labour trends and patterns.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xgpb-sex-age-geo-nb-children-in-child-labour-general-production-bounda 数据集图片
构建方式
该数据集由Electric Sheep Asia团队基于国际劳工组织(ILO)的ILOSTAT数据库构建而成。数据直接通过ILOSTAT REST API接口获取,原始指标编码为CLD_XGPB_SEX_AGE_GEO_NB,代表按性别、年龄及城乡地域划分的童工数量(单位:千)。获取后,数据依据亚洲国家ISO3国家代码进行过滤筛选,保留了9个亚洲国家、横跨2020至2023年的302条观测记录。ILO依据国际劳工统计学家会议(ICLS)定义对各国调查微数据进行协调统一,并在source.label字段中标注数据来源以便追溯,确保数据的一致性与可核验性。
特点
该数据集的核心特色在于其精细化的多维解构能力。数据涵盖性别(男、女、总计)、年龄组(如5-17岁)以及城乡地域(全国、城市、农村)等多个分类维度,支持对童工现象的交叉分析。所有观测值均已标准化为年度频率,且ILO针对同一国家年份的多个数据源选用了‘最佳来源’作为最终值,保障了数据的权威性与可比性。此外,数据集保留了观测状态标记(如‘不可靠’)及序列断裂注释,为用户提供了重要的数据质量透明度。
使用方法
该数据集专为机器学习和统计分析场景设计,依托HuggingFace Datasets库实现便捷加载。用户可通过`load_dataset()`函数一键获取数据,并将其轻松转换为pandas DataFrame格式进行探索。针对性分析操作简洁高效,例如通过`ref_area`列可快速筛选特定国家子集;利用`indicator`与`time`列可绘制单个童工指标的时间序列趋势图;借助`pivot_table`方法能将数据重塑为国家×年份的矩阵结构,便于进行面板数据分析或跨国产出比较,充分满足从描述性统计到建模预测的多样化研究需求。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2023年创建,通过其ILOSTAT数据库发布,并由Electric Sheep Asia团队重新封装,旨在系统性地追踪亚洲地区儿童劳动现象的规模与分布。核心研究问题聚焦于按性别、年龄及城乡地域划分的儿童劳动参与率,测量基于一般生产边界(General Production Boundary)的童工数量。数据集涵盖2020至2023年间9个亚洲国家的302个观测值,为劳动经济学、儿童发展社会学及国际发展政策研究提供了标准化、可复用的量化依据。其影响力体现在为联合国可持续发展目标(SDG)中的体面工作指标(如SDG 8.7)提供了区域级的实证支撑,推动了跨国比较分析与数据驱动的政策评估。
当前挑战
该数据集面临的核心领域挑战在于童工现象的隐蔽性与测量复杂性:儿童劳动因性质模糊(如家庭帮工、非正规经济从业)而难以界定,且受文化观念与社会污名化影响,家庭或雇主常瞒报数据,导致调查结果存在系统性偏差。构建过程中,技术挑战源于跨国数据异构性——各国劳动力调查的问卷设计、抽样框架及统计口径差异显著,ILO虽基于国际劳工统计学家会议(ICLS)定义进行协调,但数据中“联合国报告”标志(如obs_status为‘U’)仍揭示了部分观测值的不可靠性。此外,数据稀疏性(302条观测对应9国4年)及维度局限(仅一个核心指标)限制了时间序列预测与区域细粒度分析的精度,而分类变量的缺失(如只有性别维度)则阻碍了对童工成因的深层因果推断。
常用场景
经典使用场景
该数据集聚焦于亚洲九国(如蒙古、阿富汗、越南等)2020至2023年间儿童劳动参与情况,按性别、年龄组及城乡地域提供细化统计。其经典用途在于借助国际劳工组织(ILO)规范口径,开展跨国家、跨时段的儿童劳动发生率比较研究。研究者可基于‘sex’与‘classif2’等分类维度,剖析不同性别及城乡环境下童工分布的结构性差异,也可结合历年的‘obs_value’数值追踪趋势变迁,为发展经济学与劳动经济学中的弱势群体保护问题提供量化依据。
实际应用
在实际应用中,该数据集对国际发展组织、国家劳工部门及非政府机构具有明确的决策支持价值。基于性别与地域的精细分层,各级政府可精准锁定童工高发群体与区域,优化干预资源的投放策略。劳动监察系统可依据历年数据评估已有禁止童工立法与教育普惠政策的实施成效,为修订最低就业年龄法案或设计城乡导向型助学计划提供实证基石。同时,该数据也服务于联合国可持续发展目标(SDG 8.7)的进度监测。
衍生相关工作
围绕该数据集衍生的一系列经典工作集中于儿童劳动的多维测度与驱动因素建模。研究者常将其与ILO旗下的就业、教育及家庭收入调查数据集融合,构建包含家庭经济压力、学龄入学率及当地产业结构的解释模型。另一方面,基于该数据严格按ILOSTAT码表整理的标签体系,学界已开发出专用于发展中国家童工风险预测的时间序列模型与空间聚类分析框架,显著提升了跨国动态监测与早期预警能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务