遇见数据集

electricsheepasia/asia-ilo-cld-xsna-sex-age-stu-nb-children-in-employment-by-sex-age-and-school-atten

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的童工数据,专门针对亚洲地区。数据集涵盖了32个亚洲国家从1996年至2025年的2075个观察值,聚焦于一个核心指标:按性别、年龄和上学出勤状态划分的就业儿童(千)。数据通过ILOSTAT REST API获取,并经过筛选以仅包括亚洲国家代码。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类、年龄和上学出勤状态分类、观察年份、观察值以及数据质量标志。该数据集适用于表格分类、回归和时间序列预测任务,旨在为研究人员和开发者提供机器学习就绪的亚洲童工数据,支持分析和模型开发。

This dataset contains child labour data from the International Labour Organization (ILO) ILOSTAT database, specifically focused on Asia. It includes 2,075 observations across 32 Asian countries spanning 1996 to 2025, covering one distinct indicator: Children in employment by sex, age and school attendance status (thousands). Data is pulled directly from the ILOSTAT REST API and filtered to Asia ISO3 country codes. The dataset provides a detailed schema with columns such as country code, country name, data source, indicator code, sex disaggregation, age and school attendance classifications, observation year, observed value, and data quality flags. It is suitable for tabular classification, regression, and time-series forecasting tasks, aiming to offer machine learning-ready data on child labour in Asia for researchers and developers to support analysis and model development.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xsna-sex-age-stu-nb-children-in-employment-by-sex-age-and-school-atten 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接提取`CLD_XSNA_SEX_AGE_STU_NB`指标数据,并依据ISO3国家代码筛选出亚洲区域。数据采集遵循国际劳工统计学家会议(ICLS)定义,对原始调查微观数据进行了统一标准化处理,同时保留了`source.label`字段以标示数据来源,确保可追溯性。最终汇集了亚洲32个国家从1996年至2025年间的2,075条观测记录,覆盖童工就业领域的关键指标。
特点
本数据集的核心特色在于其精细的多维分类体系,包含性别(男、女、总计)、年龄段及在校状况等多个维度,能够支持从宏观整体到细分群体的多层次分析。数据均经过ILO官方统一质量管控,优先采用经ILO筛选的“最佳来源”,保证了跨时间和跨国家数据的一致性。此外,数据集以年度频率呈现,便于进行长跨度的时序分析,为研究亚洲区域童工现象的动态演变提供了可靠的基础。
使用方法
用户可通过HuggingFace的`datasets`库便捷加载数据,一键转换为Pandas DataFrame进行后续分析。例如,可依据`ref_area`字段轻松筛选特定国家(如印度尼西亚)的观测值,或利用`time`和`obs_value`列绘制单一指标的时间序列曲线。研究者也能借助透视表功能将数据重塑为国家×年份的矩阵,以观察横向对比。该数据集直接支持分类、回归以及时间序列预测等多种任务,适用性广泛。
背景与挑战
背景概述
童工现象作为全球劳动力市场中的一项严峻挑战,长期受到国际社会的密切关注。国际劳工组织(ILO)通过其核心统计数据库ILOSTAT,系统性地收集并发布了涵盖就业、失业、工资及童工等多维度的劳动统计指标。该数据集由Electric Sheep Asia于2025年重新打包发布,聚焦于亚洲32个国家1996至2025年间童工就业的性别、年龄及就学状况分布,包含2075条观测记录。其核心研究问题在于揭示亚洲区域内童工现象的规模、结构特征及其与教育参与之间的复杂关联,为政策制定者、研究机构及国际组织提供标准化、可比较的量化依据。该数据集不仅延续了ILO在劳动统计领域的权威性,更通过精细化的分类维度(如性别、年龄组及教育状态)提升了区域童工研究的粒度与深度,对推动联合国可持续发展目标中关于消除童工与保障教育权利的具体实践具有重要支撑价值。
当前挑战
该数据集在领域问题层面所面临的挑战源于童工现象的隐蔽性与监测难度。亚洲地区童工活动常以非正规经济、家庭内部劳作或季节性雇佣形式存在,传统调查手段难以全面捕捉其真实规模与动态变化,导致观测值可能存在系统性低估。此外,不同国家间劳动统计定义(如ILO的ICLS标准)的采纳程度与执行质量参差不齐,使得跨国比较时常因口径差异而缺乏严格可比性。在构建过程中,数据整合需克服多重来源(如劳动力调查、多指标类集调查等)的异质性,ILO虽已采用‘最佳来源’选择策略以统一指标,但不同调查间的抽样框架、问卷设计及时间跨度差异依然对数据的一致性与连续性构成威胁。同时,部分国家特定年份的观测值被标记为‘不可靠’(obs_status='U')或存在序列中断(如方法论修订),这进一步增加了时间序列建模与趋势推断的难度。
常用场景
经典使用场景
该数据集以亚洲32个国家为地理框架,系统记录了1996年至2025年间受雇儿童按性别、年龄及就学状态分组的观测数据,共计2075条。其经典使用场景聚焦于多维度交叉分析,研究者可基于性别、年龄段(如5-17岁)与教育参与状况等分类变量,深入剖析亚洲地区童工现象的分布特征与演变规律。同时,该数据以年度时间序列形式呈现,为纵向趋势研究提供了坚实支撑,常被用于构建面板数据模型,以探究童工发生率与经济发展水平、教育普及率之间的动态关联。
衍生相关工作
该数据集衍生了一系列具有影响力的学术探索与工具开发。在方法论层面,研究者基于其时间序列维度构建了预测模型,例如利用长期趋势数据进行自回归移动平均(ARIMA)分析,以预判未来童工规模的变动方向。同时,该数据集常与ILOSTAT体系下其他劳动指标(如失业率、最低工资水平)联合使用,构成多维劳动力市场画像,催生了关于童工现象与家庭经济脆弱性交互机制的量化研究。此外,数据集的标准化重新打包版本为Hugging Face生态中的二次开发铺平了道路,支持了迁移学习在低资源地区童工预测中的初步尝试,并促进了面向亚洲区域的公平劳动政策模拟系统构建。
数据集最近研究
最新研究方向
基于ILOSTAT框架构建的亚洲童工数据集,正成为劳动经济学与可持续发展目标监测领域的前沿研究基石。该数据覆盖1996至2025年间32个亚洲国家的就业童工按性别、年龄及就学状况的细分观测,为揭示亚洲地区童工现象的时空演变规律提供了稀缺的跨国务工面板数据。当前研究热点聚焦于利用该数据集量化分析新冠疫情后亚洲童工反弹趋势、教育中断对儿童劳动参与率的滞后效应,以及通过时序建模预测实现SDG 8.7目标(消除童工)的关键路径。其细颗粒度的分类维度还推动着机器学习方法在识别高风险人群与评估干预政策有效性方面的创新应用,为国际劳工组织及各国决策者制定精准反童工策略注入了数据驱动的实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务