遇见数据集

electricsheepasia/asia-ilo-cld-xchl-sex-age-eco-nb-children-in-child-labour-by-sex-age-and-economic-a

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含2,608个观测值,涉及29个亚洲国家从1996年至2025年的童工数据。核心指标为按性别、年龄和经济活动划分的童工人数(以千计),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集以表格形式存储,包含国家代码、性别、年龄分类、经济活动和观测值等列,适用于表格分类、回归和时间序列预测等机器学习任务。数据经过ILO的标准化处理,并包含来源和质量标记。

This dataset contains 2,608 observations of child labour data across 29 Asia countries, spanning from 1996 to 2025. The key indicator is Children in child labour by sex, age and economic activity (thousands), sourced from the International Labour Organization (ILO) ILOSTAT database via API and filtered for Asia. The data is stored in tabular format with columns such as country code, sex, age classification, economic activity, observation year, and observed value, suitable for machine learning tasks like tabular classification, regression, and time-series forecasting. The data is harmonized by ILO and includes source and quality flags.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xchl-sex-age-eco-nb-children-in-child-labour-by-sex-age-and-economic-a 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据,通过其REST API接口提取指标CLD_XCHL_SEX_AGE_ECO_NB的原始数据,并依据亚洲ISO3国家代码进行地理筛选。数据经过ILO基于国际劳工统计学家会议(ICLS)定义的系统性协调处理,确保不同调查来源的微观数据具有可比性。最终由Electric Sheep Asia团队进行重新打包,形成结构化的表格数据,保留了原始调查来源标识以增强可追溯性。
特点
数据集涵盖1996年至2025年间29个亚洲国家的2608条观测记录,聚焦于童工数量这一核心指标,按性别、年龄组及经济活动类别进行精细分层。其独特之处在于提供了ILO认定的‘最佳来源’数据,避免了多源冲突,同时观测状态标识(如不可靠值)和序列断裂注释为数据质量评估提供了透明依据,适用于时间序列分析与区域比较研究。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并转换为Pandas DataFrame进行灵活操作。典型用法包括按国家代码筛选子集(如印度尼西亚)、对单一指标按时间排序后绘制趋势图,或利用pivot_table构建国家×年份的矩阵以便于面板数据分析。数据集特别适合进行童工现象的跨国纵向研究以及社会经济影响因素的回归建模。
背景与挑战
背景概述
童工问题作为全球劳动权益领域的核心关切,长期以来受到国际社会的广泛关注。国际劳工组织(ILO)下属的ILOSTAT数据库作为全球劳动统计的权威来源,系统收集并整理了涵盖200多个经济体的劳动指标数据。在此背景下,Electric Sheep Asia于2025年基于ILOSTAT官方API,重新封装并发布了亚洲童工数据集,聚焦于“按性别、年龄和经济活动分类的童工数量(千人)”这一核心指标。该数据集包含29个亚洲国家从1996年至2025年的2608条观测记录,由ILO统计局负责数据协调与质量把控,为研究亚洲地区童工现象的时空演变、性别差异及经济部门分布提供了标准化、机器可读的高质量数据支撑,对推动区域劳动政策评估与可持续发展目标(SDG)中的体面工作议题具有重要意义。
当前挑战
该数据集所应对的领域核心挑战在于:童工数据的跨国可比性与精细化分解长期受制于各国调查方法、统计口径与时间频率的差异。ILOSTAT虽通过国际劳工统计学家会议(ICLS)定义进行数据协调,但观测状态中仍存在“不可靠”(Unreliable)或“方法论修订”等标记,反映了原始数据质量不一的现实。构建过程中面临的挑战包括:从REST API拉取亚洲国家数据时需手动过滤ISO3国家代码,且部分国家(如阿富汗、也门)仅提供单一年份数据,导致时间序列不完整;多源数据合并时,ILO虽选取“最佳来源”,但同一国家不同年份可能源于相异调查(如劳动力调查与家庭收支调查),带来指标定义偏差;此外,性别与年龄分类变量的非空约束进一步限制了多维交叉分析的数据量,增加了模型训练与趋势推断的难度。
常用场景
经典使用场景
该数据集广泛应用于童工问题的量化研究,尤其在亚洲区域的经济与社会发展领域。研究者通常利用其中按性别、年龄和经济活动分类的童工人数观测值,构建面板数据模型,分析童工现象的分布特征及其与各国经济指标(如GDP、贫困率)的关系。经典场景包括跨国比较分析、时序趋势挖掘以及性别差异评估,常见于国际劳工组织(ILO)发布的年度报告、发展经济学论文以及联合国可持续发展目标(SDG 8.7)的进展监测中。
实际应用
在实际应用中,该数据集被国际组织、政府机构及非政府组织用以制定和评估反童工政策。例如,ILO利用其监测各国在消除童工方面的进展,识别高风险产业和地区;亚洲各国劳工部门可结合本国数据调整教育补贴与社会保障方案。此外,发展金融机构(如亚洲开发银行)将其作为项目可行性研究的依据,优化扶贫与劳动力市场干预措施,从而在源头上减少童工现象。
衍生相关工作
基于该数据衍生了一系列经典工作,包括ILO定期发布的《全球童工报告》中亚洲区域专项分析,以及多篇发表于《World Development》、《Journal of Development Economics》等期刊的实证研究。其中,学者常以此数据验证“贫困陷阱”假说,或构建机器学习模型预测童工风险等级。此外,Electric Sheep Asia的再封装版本极大降低了数据获取与预处理门槛,催生了多个面向亚太地区的因果推断与政策模拟项目。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务