遇见数据集

electricsheepasia/asia-ilo-cld-xchl-sex-age-geo-nb-children-in-child-labour-by-sex-age-and-rural-urba

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲27个国家从1996年至2025年的童工数据,共1,581个观测值,核心指标为按性别、年龄和城乡地区划分的童工数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并针对亚洲国家进行过滤。数据集提供了详细的分类维度,包括性别(总计、男性、女性)、年龄组和城乡地区类型,以及观测年份和数值。数据以年度频率发布,并包含数据质量标志(如不可靠状态)。数据集旨在支持表格分类、回归和时间序列预测等任务,适用于研究亚洲童工趋势和政策分析。数据集由Electric Sheep Asia重新打包,以Parquet格式提供,便于机器学习使用。

This dataset contains 1,581 observations of child labour data across 27 Asia countries, spanning 1996–2025, with a core indicator Children in child labour by sex, age and rural / urban areas (thousands). Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asia ISO3 country codes. It includes disaggregation dimensions such as sex (total, male, female), age groups, and rural/urban areas, along with observation years and values. The data is annual frequency and includes quality flags (e.g., unreliable status). The dataset is designed for tabular classification, regression, and time-series forecasting tasks, supporting research on child labour trends in Asia. Repackaged by Electric Sheep Asia in Parquet format for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xchl-sex-age-geo-nb-children-in-child-labour-by-sex-age-and-rural-urba 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接抽取指标代码为CLD_XCHL_SEX_AGE_GEO_NB的原始数据,并依据亚洲ISO3国家代码进行地理过滤。数据由Electric Sheep Asia进行再封装与标准化处理,保留了ILOSTAT基于国际劳工统计学家会议(ICLS)定义对调查微观数据进行协调后的字段,并在source.label列中标注了数据来源,确保其可追溯性与统计口径的一致性。
特点
数据集涵盖1996年至2025年间亚洲27个国家的童工数据,总计1581条观测记录,包含1个核心指标(按性别、年龄及城乡地区划分的童工人数)。数据以年度频率呈现,提供了性别(总、男、女)等细分维度,并附有观测状态标签(如可靠性标记)及指标注释(如方法论修订引起的序列断点),便于用户进行质量评估与数据筛选。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并将其转换为Pandas DataFrame进行分析。支持按国家代码筛选特定国家的数据,或针对单一指标按时间排序绘制时间序列图。此外,可利用数据透视功能将数据集重构为国家×年份的矩阵形式,便于进行跨区域的横向对比与纵向趋势分析,适用于表格分类、回归及时间序列预测等任务。
背景与挑战
背景概述
童工问题作为全球劳动力市场中的一项严峻挑战,长期受到国际劳工组织(ILO)的高度关注。该数据集由国际劳工组织于2025年通过其核心统计数据库ILOSTAT发布,经Electric Sheep Asia重新打包整理,聚焦亚洲地区1996至2025年间27个国家的童工状况。核心研究问题在于系统量化不同性别、年龄段及城乡地域背景下童工群体的规模与分布特征,为监测可持续发展目标中体面劳动指标的实现进程提供数据支撑。数据集涵盖1,581条观测记录,依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一处理,在劳动经济学、发展社会学及国际政策评估领域具有显著的基础性参考价值。
当前挑战
该数据集面临的主要挑战首先源于童工问题的隐蔽性与测量复杂性:各国对童工的法律定义、调查覆盖范围及数据采集频率存在显著差异,ILO虽通过统一方法论进行调和,但不同来源间的统计口径差异仍可能影响跨国家与跨年度的可比性。在数据构建过程中,关键挑战集中在多源数据整合与质量控制:原始数据依赖各国劳动力调查、家庭收支调查及行政记录等多种渠道,ILO需从中筛选出每一年份每个国家的最佳数据来源,同时应对因方法论修订(如指标代码I11:264所示)导致的序列断点问题,观测状态标记为不可靠的数据记录更增加了分析师在建模预测时的不确定性。
常用场景
经典使用场景
该数据集记录了亚洲27个国家1996至2025年间童工数量的细致统计,涵盖性别、年龄段(5-17岁)以及城乡地域的交叉分类,为劳动经济学、发展社会学及儿童保护领域的研究提供了宝贵的结构化面板数据。其最常见的应用场景是作为时间序列与横截面混合数据,用于追踪和比较不同亚洲国家童工现象的演变趋势、城乡差异及性别不平等程度,使研究者能够精准识别童工问题最严峻的地区与群体,为后续的实证分析奠定坚实的数据基础。
实际应用
该数据集的实际应用已超越学术范畴,成为国际组织、政府机构与非政府组织制定和评估儿童保护政策的关键工具。通过分析不同国家、性别及城乡的童工分布格局,政策制定者能够精准定位需要优先干预的地区与群体,从而优化资源配置。例如,基于数据揭示的特定时段童工人数波动,可评估相关劳动法规或扶贫项目的实际成效。此外,数据还为联合国可持续发展目标(SDG 8.7,即消除童工)的全球进展监测提供了准确的亚洲区域指标,助力问责与行动规划的推进。
衍生相关工作
在此数据集基础上,已衍生出一系列具有影响力的经典工作。一方面,研究者利用其长时间跨度特性,构建童工规模的预测模型,结合GDP增长率、入学率等社会经济变量,前瞻性地识别未来干预重点。另一方面,该数据被广泛用于验证与修正劳动经济学中的理论模型,如探讨家庭决策中收入与儿童教育之间的替代关系,或评估最低工资法与义务教育年限对降低童工比例的实际效果。同时,数据也催生了可视化报告与动态仪表盘等知识传播工具,使复杂的统计信息得以直观呈现,极大地促进了科研成果向公共知识的转化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务