遇见数据集

electricsheepasia/asia-ilo-cld-xgpb-sex-age-eco-nb-children-in-child-labour-general-production-bounda

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含220个观测值,涉及5个亚洲国家(孟加拉国、蒙古、老挝、马尔代夫、亚美尼亚)在2019年至2022年期间的儿童劳动数据。核心指标为CLD_XGPB_SEX_AGE_ECO_NB,表示按性别、年龄和经济活动划分的儿童劳动数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理。数据集提供了详细的结构化信息,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、年龄分组(如15-17岁)、经济部门、观测年份、观测值以及数据状态标记等。数据以年度频率发布,并包含数据质量说明,如使用ILO选择的最佳来源。该数据集旨在支持儿童劳动问题的研究、分析和预测任务,适用于表格分类、回归和时间序列预测等机器学习应用。

This dataset contains 220 observations of child labour data across 5 Asia countries (Bangladesh, Mongolia, Lao Peoples Democratic Republic, Maldives, Armenia), spanning 2019–2022. It focuses on the indicator CLD_XGPB_SEX_AGE_ECO_NB, which measures children in child labour by sex, age, and economic activity (in thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asian countries. The dataset includes structured columns such as country codes, country names, data sources, indicator codes, sex disaggregation (total, male, female), age classifications (e.g., 15-17), economic sectors, observation years, observed values, and data status flags. It is published at annual frequency and includes quality notes, such as the use of ILO-selected best sources. This dataset is designed for research, analysis, and forecasting on child labour issues, suitable for machine learning tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xgpb-sex-age-eco-nb-children-in-child-labour-general-production-bounda 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT数据库,聚焦亚洲地区童工现象。研究团队通过ILOSTAT的REST API直接抓取“一般生产边界下童工”指标(CLD_XGPB_SEX_AGE_ECO_NB)的原始数据,并依据ISO 3166-1 alpha-3标准对亚洲国家进行筛选。数据整合过程中严格遵循国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、家庭收入调查等来源的微观数据进行标准化处理,并在source.label字段保留溯源信息,确保每一条观测值的可追溯性。最终该数据集共收录220条观测记录,涵盖2019年至2022年间5个亚洲国家的童工数据。
特点
本数据集的核心特色在于其精细的维度划分与权威的数据来源。数据按性别(男性、女性、总计)、年龄组(如15-17岁)及经济活动(广义行业)进行多维度拆解,使研究者能够深入剖析童工现象的群体与行业分布特征。数据集中包含obs_status字段,对数据的可靠性进行标记(如标注“不可靠”),有助于用户进行数据质量评估。此外,每个观测值都附带了原始调查的来源代码及注释信息(如系列中断与方法修订),这为识别数据波动背后的方法论变化提供了关键线索,显著提升了数据分析的透明度和严谨性。
使用方法
使用该数据集极为便捷,用户可通过HuggingFace的datasets库直接加载。仅需一行代码 load_dataset() 即可将数据导入为Pandas DataFrame格式。典型操作包括按国家筛选子集(如过滤出印度尼西亚数据)、构建指定指标的时间序列进行可视化分析,或通过pivot_table方法重塑数据为以年份为行、国家为列的矩阵形式,便于进行跨国民间比较或面板数据建模。数据集采用cc-by-4.0许可协议发布,用户在使用时需同时标注ILO原始出处及Electric Sheep Asia的再包装版本,以保证学术规范与版权合规。
背景与挑战
背景概述
国际劳工组织(ILO)旗下的ILOSTAT数据库是全球劳动力统计的权威来源,整合了来自200多个经济体的调查与行政记录数据。在此背景下,亚洲童工数据集(asia-ilo-cld-xgpb-sex-age-eco-nb-children-in-child-labour-general-production-bounda)应运而生,由Electric Sheep Asia于2022年重新打包并发布于HuggingFace平台,旨在提供标准化、机器学习就绪的亚洲童工统计资料。该数据集聚焦2019至2022年间五个亚洲国家(孟加拉国、蒙古、老挝、马尔代夫、亚美尼亚)的童工现象,涵盖按性别、年龄及经济活动分类的一般生产边界指标,共计220条观测值。其核心研究问题是揭示亚洲区域童工分布的异质性,为可持续发展和体面劳动目标提供量化依据。作为ILOSTAT数据的精炼版本,该数据集降低了跨国研究的数据获取门槛,对劳动经济学、社会政策及机器学习在社会科学中的应用产生了积极影响。
当前挑战
该数据集面临的核心挑战包括:一是领域问题层面,童工现象本身具有隐蔽性和动态性,家庭调查的受访者可能因法律或社会压力低报童工活动,导致观测值存在系统性偏差;同时,各国对童工定义的执行差异(如国际劳工统计学家会议标准与本地法律间的张力)削弱了跨国可比性,而数据集仅覆盖5个亚洲国家,样本稀疏性限制了泛化能力。二是构建过程层面,ILOSTAT原始数据源自多项不同调查(如劳动力调查、家庭收入调查),其抽样框与指标口径并非完全一致,数据整合时需处理‘最佳来源’选择与断点标记(如‘methodology revised’注释),但注释信息并未统一为可机读的元数据;此外,220条观测中包含‘不可靠’(obs_status='U')的标注,且缺失值处理规则不透明,使用者需额外清洗,这增加了下游机器学习建模的预处理复杂度。
常用场景
经典使用场景
该数据集聚焦于亚洲地区儿童参与童工劳动的现象,提供了按性别、年龄和经济活动划分的童工统计数据,涵盖2019至2022年间五个亚洲国家的220条观测值。其最经典的使用场景在于作为时间序列与面板数据分析的基础素材,研究者可借此构建跨国、跨年份的量化模型,以剖析童工问题的演变趋势、地区差异以及结构性特征。通过整合ILOSTAT的标准化指标,数据集为探讨童工发生率与经济发展阶段、劳动力市场政策之间的关联提供了可靠的实证依据,常被用于政策评估与比较研究之中。
衍生相关工作
围绕该数据集的丰富维度,学术界已衍生出多项经典工作。在研究方法上,它被用于开发分布滞后模型和混合效应回归框架,以精确分离时间趋势与国家固定效应;在应用方向,催生了一系列聚焦于童工劳动与贫困陷阱、代际传递效应的实证论文。此外,数据集的交叉分类特性启发研究者构建社会经济地位与童工参与概率的联合分布模型,进而评估最低就业年龄法律的边际影响。基于该数据的分类和回归任务,也推动了机器学习方法在劳动经济学中的应用,如利用随机森林或梯度提升模型预测童工高风险群体,从而为早期预警系统的开发铺平了道路。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区童工现象的量化分析,通过国际劳工组织(ILO)的标准化统计框架——一般生产边界(General Production Boundary),按性别、年龄及经济活动类别对童工人数进行细分观测。当前该领域的前沿研究方向正从传统的宏观描述转向精细化与动态化建模,例如利用该数据集结合机器学习方法揭示童工分布的时空异质性,特别是在孟加拉国、蒙古等劳动力密集型经济体中,童工现象与贫困陷阱、教育缺失以及供应链伦理之间的深层关联。数据集涵盖2019至2022年的年度观测值,恰逢新冠疫情对全球劳动力市场造成剧烈冲击,为评估后疫情时期童工反弹风险以及政策干预效果(如国际劳工组织第182号公约的落实情况)提供了宝贵的时间序列证据。其跨国家的标准可比性,使得研究者能够构建异质性处理效应模型,精准识别高风险亚群体,从而推动从宏观统计向循证干预的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务