遇见数据集

electricsheepasia/asia-ilo-cld-xhaz-sex-age-eco-nb-children-in-hazardous-work-by-sex-age-and-economic

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲29个国家从1996年至2025年关于儿童从事危险工作的统计数据,共有2,489个观测值。核心指标是CLD_XHAZ_SEX_AGE_ECO_NB,即按性别、年龄和经济活动划分的从事危险工作的儿童数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集提供了详细的分类维度,包括性别(总计、男性、女性)、年龄组和经济部门,并包含国家代码、观测年份、观测值、数据来源和质量标志等信息。该数据集旨在支持表格分类、回归和时间序列预测等任务,适用于研究亚洲地区的童工问题。

This dataset contains statistical data on children engaged in hazardous work across 29 Asian countries from 1996 to 2025, with a total of 2,489 observations. The core indicator is CLD_XHAZ_SEX_AGE_ECO_NB, which refers to the number of children engaged in hazardous work (in thousands) categorized by sex, age group and economic activity. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via API and filtered to include only Asian countries. The dataset provides detailed classification dimensions, including sex (total, male, female), age groups and economic sectors, and also contains information such as country codes, observation years, observed values, data sources and quality flags. This dataset is intended to support tasks such as tabular classification, regression and time series forecasting, and is suitable for research on child labor issues in the Asian region.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xhaz-sex-age-eco-nb-children-in-hazardous-work-by-sex-age-and-economic 数据集图片
构建方式
该数据集由Electric Sheep Asia团队基于国际劳工组织(ILO)的ILOSTAT数据库重新整理而成。数据通过ILOSTAT REST API直接拉取指标编码为CLD_XHAZ_SEX_AGE_ECO_NB的原始数据,并依据ISO 3166-1 alpha-3标准筛选出亚洲29个国家的观测记录。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行统一协调,原始数据来源涵盖劳动力调查、住户收入调查等,并在source.label字段中标注以供追溯,最终形成包含2,489条观测、覆盖1996至2025年时间跨度的结构化表格数据。
特点
该数据集聚焦于亚洲地区从事危险工作的儿童群体,按性别、年龄和经济活动进行细分,提供了唯一指标“从事危险工作的儿童人数(千)”。数据包含29个亚洲国家的长面板记录,其中伊朗、巴基斯坦、印度等国的观测数量最为丰富。数据模式中除核心的观测值obs_value外,还包含性别(sex)、两个分类变量(classif1和classif2)等维度的分解信息,以及数据质量标记(如obs_status标注不可靠数据)和源注释字段,便于用户评估数据可靠性与进行多维度交叉分析。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,转换为Pandas DataFrame后即可进行灵活分析。典型应用包括按国别筛选数据以研究特定国家的时间趋势,或对单一指标按时间排序后绘制序列图。数据集还支持透视操作,例如构建以年份为行、国家为列的矩阵,便于比较不同国家在同一指标上的动态变化。此外,性别维度的分解允许研究者分别考察男童与女童面临的危险工作状况差异,而分类变量则为进一步按年龄组或经济部门深入分析提供了途径。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2025年整理发布,并由Electric Sheep Asia团队重新封装于HuggingFace平台,聚焦于1996年至2025年间亚洲29个国家的儿童从事有害工作的观测数据,总计2,489条记录。作为全球劳动统计的权威来源,ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,旨在揭示不同性别、年龄及经济活动中儿童劳动的分布格局。该数据集为可持续发展目标中消除童工现象的监测与评估提供了关键定量基础,对亚洲地区劳动政策制定、学术研究及国际比较分析具有重要影响力。
当前挑战
该数据集所应对的领域挑战在于,亚洲地区儿童从事有害工作的现象长期缺乏系统性、跨国的可比数据支撑,现有国家统计在定义、方法和覆盖面上存在显著差异,导致政策干预难以精准定位。构建过程中面临的核心挑战包括:各国劳动统计制度成熟度不一,部分国家数据稀疏且时间序列不连续;观测值存在不可靠标记,如'obs_status'字段注明的'不可靠'状态,影响模型训练与推断的置信度;经济活动的分类粒度有限,'classif2'字段仅区分到广义部门,难以解构具体行业风险;此外,数据仅提供年度频率,无法捕捉季度或月度波动,限制了时序预测的精度与政策响应的时效性。
常用场景
经典使用场景
该数据集汇聚了ILOSTAT数据库中关于亚洲29个国家1996至2025年间从事有害工作的儿童人数,按性别、年龄和经济活动类型进行细致分类,共计2489条观测记录。在劳动经济学与发展研究领域,它常被用作量化分析亚洲地区童工问题严重程度的核心数据源。研究者可利用该数据集构建时间序列模型,追踪特定国家或地区有害童工现象的演变趋势,或通过面板数据分析揭示经济发展、政策干预与童工率变化之间的关联。其结构化的多维度标签(性别、年龄、行业)为开展细分群体比较提供了坚实支撑。
解决学术问题
该数据集直接回应了学界长期困扰于跨国童工数据碎片化、口径不一的关键障碍。通过ILO统一的统计标准(ICLS定义)进行数据调和,它解决了跨时段、跨国别比较中因方法论差异导致的测量偏差问题。学术研究可借助该数据验证童工减少与义务教育普及、社会保障体系完善之间的因果效应,探讨性别不平等在有害劳动参与中的分布规律,以及不同经济部门(如农业、服务业、制造业)对童工吸纳的结构性差异。其存在使得关于可持续发展目标8.7(消除强迫劳动、现代奴隶制和童工)的定量评估具备了可靠的数据基础。
衍生相关工作
该数据集已衍生出一系列具有影响力的学术与政策分析工作。例如,基于性别与经济活动交叉分类的分解研究揭示了制造业中男性童工的隐性风险,而围绕特定国家(如印度、巴基斯坦)的子集分析则催生了关于家庭贫困代际传递与童工决策的微观计量论文。在方法论层面,研究者利用该数据开发了面向稀疏面板数据的插补算法与贝叶斯分层模型,以应对部分国家观测年份不连续的问题。ILO自身的年度旗舰报告《全球童工估计》(Global Estimates of Child Labour)也引用了类似结构的数据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务