遇见数据集

electricsheepasia/asia-ilo-cld-xgpb-sex-age-rt-share-of-children-in-child-labour-general-producti

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲33个国家从1996年至2025年的儿童劳动统计数据,重点关注按性别和年龄划分的儿童劳动参与率(广义生产边界)。数据集共包含645个观测值,涵盖1个核心指标(CLD_XGPB_SEX_AGE_RT),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理。数据列包括国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、观测年份、观测值及状态标志等,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,采用CC-BY-4.0许可。

This dataset encompasses child labor statistics for 33 Asian countries spanning the period from 1996 to 2025, with a primary focus on child labor participation rates (General Production Boundary) disaggregated by sex and age. It comprises a total of 645 observations, covering one core indicator: CLD_XGPB_SEX_AGE_RT. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via its API and standardized. The data columns include country code, country name, data source, indicator code, sex classification, age classification, observation year, observed value, and status flag, among others. It is applicable to tasks such as table classification, regression analysis, and time series forecasting. The dataset was repackaged by Electric Sheep Asia and is licensed under CC-BY-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xgpb-sex-age-rt-share-of-children-in-child-labour-general-producti 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API接口直接获取原始指标数据,并经由Electric Sheep Asia团队进行二次加工与整合。构建过程中,数据被过滤至亚洲33个国家的ISO3代码范围,并保留了ILOSTAT基于国际劳工统计学家会议定义对调查微观数据进行统一处理的痕迹,同时通过source.label字段标注数据来源以供追溯。最终以Parquet格式打包,形成包含645条观测值、覆盖1996年至2025年时间跨度的标准化表格数据集,支持机器学习与统计分析的快速调用。
特点
该数据集聚焦于亚洲地区儿童劳动参与率的量化刻画,核心指标为“一般生产边界内按性别与年龄划分的儿童劳动比例”。其突出特点在于提供多维度的分组结构,包含性别(总计、男性、女性)与年龄(如5-17岁)等分类变量。数据来源以劳动力调查、家庭收入调查等官方统计为主,并标注了数据质量状态(如“不可靠”标记)与方法论修订等注释信息。此外,数据集还记录了国家、年份与指标代码的对应关系,便于进行跨年度、跨国别的面板数据分析。
使用方法
数据集通过HuggingFace Datasets库的load_dataset函数即可直接调用,并轻松转换为Pandas DataFrame进行后续分析。使用者可按国家代码筛选子集,例如提取印度尼西亚的全部数据。针对时间序列分析,可依据指标代码(如CLD_XGPB_SEX_AGE_RT)对obs_value字段按年份排序后可视化。若需构建国家×年份的矩阵数据,可利用pivot_table方法将观测值重塑为面板格式,便于进行横向比较或计量建模。该数据集还兼容表格分类、回归及时间序列预测等多种任务场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT整理发布,并由Electric Sheep Asia重新封装为机器学习就绪格式。其核心研究议题聚焦于亚洲地区儿童劳动参与的普遍性与结构性特征,具体以“一般生产边界下的儿童劳动比例”为指标,按性别与年龄进行精细分层。涵盖33个亚洲国家、1996至2025年间的645条观测记录,为研究亚洲儿童劳动的经济、社会与发展动因提供了跨国纵向数据基础。该数据集在劳动经济学、儿童发展政策及可持续发展目标(SDG)监测等领域具有重要影响力,尤其填补了亚洲地区标准化、跨时间序列儿童劳动数据的稀缺性,推动了基于证据的政策制定与国际比较研究。
当前挑战
该数据集所应对的领域挑战在于:儿童劳动问题长期受限于数据口径不一、调查频率稀疏及跨国可比性薄弱,难以捕捉其真实规模与动态趋势。国际劳工组织需协调各国基于不同调查方法(如劳动力调查、多指标群组调查)的原始微观数据,并依循国际劳工统计学家会议(ICLS)定义进行统一标准化,过程涉及来源标注、断点修正与最佳来源筛选。构建过程中面临数据异质性、部分国家年份缺失、观测状态标识不完整(如“不可靠”标记)及方法论变更导致的序列断点等具体困难。此外,数据集仅包含年度频率,缺乏更高频的月度或季度观测,限制了短期波动与政策即时效应的分析能力。
常用场景
经典使用场景
该数据集记录了1996年至2025年间亚洲33个国家的童工占比数据,按性别与年龄段(5-17岁)进行精细划分,涵盖645条观测值。其经典使用场景聚焦于时间序列分析与面板数据建模,研究者可藉此追踪各国童工比例的动态演变趋势,识别性别差异在童工现象中的具体表现,或通过构建回归模型探究经济发展、教育普及等宏观因素对童工率的定量影响。
衍生相关工作
围绕此数据核心,已衍生出一系列影响深远的研究工作。经典的衍生应用包括构建童工比例与家庭收入、教育入学率的关联模型,验证义务教育法案对童工率下降的因果效应。后续工作进一步拓展至性别平等视角,探讨女童童工比例与早婚、性别歧视之间的复杂纠缠。在方法论层面,研究者利用该数据集开发了缺失值插补与趋势外推算法,为不完整统计年份提供合理推断,这些技术成果已被吸纳进世界银行等机构的可持续目标(SDG)监测体系之中。
数据集最近研究
最新研究方向
当前,基于亚州地区儿童劳动参与率的时空分布与性别年龄异质性分析成为劳动经济学与可持续发展研究的前沿热点。该数据集整合了ILOSTAT权威来源、覆盖33个亚洲国家1996至2025年的645条观测值,为探究童工现象在区域经济转型、政策干预及社会变迁中的动态演变提供了珍贵的时间序列素材。结合联合国可持续发展目标8.7(消除童工)的全球议程,研究者得以量化不同性别与年龄段儿童在一般生产边界内的劳动参与份额,揭示南亚与东南亚高发地区的结构性特征,并评估新冠疫情后经济复苏对童工伤亡率的影响。数据的高频次更新与精细分类维度(如按性别、年龄组分解)有力支持了机器学习模型在预测童工风险、识别政策薄弱环节方面的前沿尝试,为推动基于证据的劳工保护策略与跨境比较研究构筑了坚实的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务