遇见数据集

electricsheepasia/asia-ilo-cld-xgpb-sex-age-nb-children-in-child-labour-general-production-bounda

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲国家童工情况的表格数据集,专门针对“按性别和年龄划分的通用生产边界内童工儿童数量(以千计)”这一指标。数据集包含100个观察值,覆盖10个亚洲国家(包括阿富汗、孟加拉国、也门、老挝、蒙古、巴勒斯坦、越南、乌兹别克斯坦、马尔代夫和亚美尼亚),时间跨度为2019年至2023年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过过滤处理。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、年龄分类、观察年份、观察值、观察状态及相关注释等。数据以年频率发布,并包含数据质量说明,例如使用ILO选择的“最佳来源”以及分类列的非空条件。该数据集适用于表格分类、表格回归和时间序列预测等任务,主要用于童工问题的研究和分析。

This dataset is a tabular dataset on child labour in Asia, specifically focusing on the indicator Children in child labour -- General Production Boundary by sex and age (thousands). It contains 100 observations across 10 Asian countries (including Afghanistan, Bangladesh, Yemen, Laos, Mongolia, Palestine, Vietnam, Uzbekistan, Maldives, and Armenia), spanning the years 2019 to 2023. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via API and filtered for Asia. The dataset includes detailed column schema such as country code, country name, data source, indicator code, indicator name, sex disaggregation, age classification, observation year, observed value, observation status, and related notes. Data is published at annual frequency and comes with quality caveats, such as the use of ILO-selected best source and non-null conditions for disaggregation columns. It is suitable for tasks like tabular classification, tabular regression, and time-series forecasting, primarily for research and analysis on child labour issues.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xgpb-sex-age-nb-children-in-child-labour-general-production-bounda 数据集图片
构建方式
童工问题作为全球劳动力市场中的痼疾,其数据的标准化与可获取性对政策制定与学术研究至关重要。本数据集基于国际劳工组织(ILO)旗下的ILOSTAT数据库构建,通过其REST API接口直接抓取指标代码为CLD_XGPB_SEX_AGE_NB的原始数据,并依据亚洲国家ISO3代码进行地理范围筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等微观数据进行统一协调处理,同时在source.label列中清晰标注数据来源,确保每条观测值的可追溯性。最终数据集整合了2019至2023年间亚洲10个国家的100条观测记录,覆盖阿富汗、孟加拉国、越南等具有代表性的经济体。
特点
该数据集涵盖了10个亚洲国家在童工领域的关键指标——按性别与年龄分组的一般生产边界童工人数(单位:千),其核心特色体现在精细的维度切分与清晰的元数据标注上。数据按性别分为总计、男性与女性三类,年龄分类则遵循ILO标准化编码,支持对童工现象的精准分层分析。每一行记录均包含16个字段,除核心的观测值obs_value外,还附有观测状态标识(如不可靠)、数据来源索引及方法修订备注,为用户提供了丰富的质量评估依据。此外,数据集以年度为时间粒度,且优先采用ILO为每个国家-年份组合筛选的“最佳来源”,有效保障了跨时期可比性。
使用方法
本数据集以HuggingFace Datasets格式发布,使用者可通过一行Python代码轻松加载至数据科学环境:从datasets库调用load_dataset函数指向本数据集仓库即可获取。加载后的数据集可直接转换为Pandas DataFrame,便于进行各类分析操作。例如,用户可按国家编码(ref_area)筛选特定国家子集,如分析印度尼西亚的童工时序变化;亦可针对单一指标按时间排序后绘制折线图,直观呈现趋势。若需构建国家-年份的面板数据矩阵,可利用pivot_table函数将ref_area列展开为列标签,实现跨国家横向对比。所有代码示例均已在数据卡片中提供,降低了使用门槛。
背景与挑战
背景概述
童工问题作为全球劳动力市场中的一项严峻挑战,长期受到国际劳工组织(ILO)的高度关注。由ILO下属统计数据库ILOSTAT于2023年发布的亚洲区域童工数据集,经由Electric Sheep Asia重新整理并发布于HuggingFace平台,聚焦于按性别和年龄划分的童工人数统计。该数据集涵盖2019至2023年间10个亚洲国家的100条观测记录,核心研究问题旨在揭示亚洲地区童工现象的规模、分布特征及其随时间演变的趋势。作为全球劳动统计的重要来源,ILOSTAT采用国际劳工统计学家会议(ICLS)标准对原始调查微观数据进行统一整合,为政策制定者、研究机构及国际组织提供了可靠的数据基础,对推动联合国可持续发展目标中关于消除童工问题的落实具有重要影响力。
当前挑战
该数据集所解决的领域问题聚焦于童工伤亡统计中的量化与监测难题:童工活动常隐藏于非正式经济中,传统统计方法难以精确捕捉其真实规模,而数据来源的多样性与各国统计标准的不一进一步增加了比较分析的复杂性。在构建过程中,挑战主要体现在三个方面:其一,数据整合需对接各国劳动力调查、家庭收入调查及行政记录等多源异构数据,处理方法论修订导致的序列断裂问题;其二,部分国家数据标注为“不可靠”,反映了原始数据质量参差不齐的现实;其三,样本量有限(仅100条观测)且时间跨度短,使得区域层面的趋势推断面临统计显著性不足的困境,影响模型训练的泛化能力。
常用场景
经典使用场景
该数据集聚焦于亚洲地区儿童劳动参与率的统计,涵盖2019至2023年间10个国家的100条观测记录。其最经典的使用场景在于构建时间序列模型或面板数据回归,以分析童工现象在特定区域随年份与人口特征的演变趋势。研究者可借助性别与年龄两个关键拆分维度,深入刻画不同子群体在一般生产边界下的劳动参与差异,从而为跨国比较与纵向跟踪提供量化基础。数据集采用ILOSTAT官方标准化指标,简洁的表格结构便于直接加载并用于统计建模或可视化探索,是劳动经济学与儿童保护领域实证分析的理想起点。
实际应用
在实际应用中,该数据集可用于国际发展机构与非政府组织的项目评估与资源分配。例如,联合国儿童基金会或世界银行可将其中性别与年龄拆解指标嵌入监测系统,动态追踪特定国家或区域童工是否随资助项目推进而下降。劳动部门亦能结合本国劳动力调查,校准微观数据与宏观整合值之间的偏差,优化统计抽样方案。此外,数据科学家能够基于该集训练分类或回归模型,搭建自动化预警平台,实时识别童工风险加剧的热点地区,从而引导现场干预资源精准投放。
衍生相关工作
该数据集的发布衍生了多项标志性工作。其一,ILOSTAT原生API的批量提取流程启发了Electric Sheep Asia构建可复制的数据管道,催生了针对亚洲区域的一整套标准化劳动统计数据集族。其二,学者基于该数据进行了童工与教育缺席率之间的联合分布建模,成果发表于劳动经济学国际会议。其三,数据集中标注的“最佳来源”选择规则激发了关于多源数据融合偏差的讨论,后续工作开发了基于贝叶斯层次模型的不确定性校正方法。此外,部分政府统计机构将其作为基准,校准本国调查框架中的测量误差,提升了官方统计的可靠性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务