遇见数据集

electricsheepasia/asia-ilo-cld-xhaz-sex-age-stu-rt-share-of-children-in-hazardous-work-by-sex-age-and

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲31个国家从1996年至2025年的1,654个观察值,重点关注儿童危险工作占比指标(CLD_XHAZ_SEX_AGE_STU_RT),即按性别、年龄和学校出勤情况划分的儿童从事危险工作的比例(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过处理,覆盖亚洲地区。数据集以表格形式呈现,包含国家代码、年份、指标值、性别分类、年龄分类、学校出勤分类等字段,并提供了数据源、观察状态和备注信息。该数据集适用于表格分类、回归和时间序列预测等任务,旨在支持劳动统计、儿童保护和社会经济研究。数据由Electric Sheep Asia重新打包,确保ML就绪格式,便于直接使用Hugging Face的datasets库加载和分析。

This dataset contains 1,654 observations of child labour data across 31 Asia countries, spanning from 1996 to 2025, covering the indicator Share of children in hazardous work by sex, age and school attendance (%) (CLD_XHAZ_SEX_AGE_STU_RT). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered for Asia. It includes tabular data with columns for country codes, years, indicator values, disaggregation by sex, age, and school attendance, along with source information, observation status, and notes. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, supporting research in labour statistics, child protection, and socio-economic analysis. Repackaged by Electric Sheep Asia for ML-ready use, it allows easy loading and analysis through Hugging Faces datasets library.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xhaz-sex-age-stu-rt-share-of-children-in-hazardous-work-by-sex-age-and 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接提取指标代码为CLD_XHAZ_SEX_AGE_STU_RT的原始观测数据,并依据亚洲ISO3国家代码进行地理筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国调查微观数据进行统一协调,数据来源包括劳动力调查、家庭收入调查及行政记录等,并在source.label字段中标注以保持可追溯性。整个数据集覆盖31个亚洲国家,时间跨度从1996年至2025年,最终整理为包含1654条观测记录的表格型数据集。
特点
该数据集聚焦于亚洲地区儿童从事有害劳动的比例,按性别、年龄和就学状况进行细致分解,包含‘SEX_T’(总计)、‘SEX_M’(男性)和‘SEX_F’(女性)三种性别分类维度。数据以年频次发布,支持多维度交叉分析,并提供了‘obs_status’字段标记观测值的可靠性,如‘U’代表不可靠,‘note_indicator’和‘note_source’字段则记录了方法修订、数据来源等元信息。数据集中每个国家-年份组合的‘最佳来源’由ILO选定,确保了数据质量与一致性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载该数据集,并将其转换为Pandas DataFrame进行后续分析。常见操作包括按国家代码筛选特定国家的数据子集,例如提取印度尼西亚的观测记录;或针对单一指标进行时间序列分析,通过排序‘time’列并绘制‘obs_value’变化趋势。此外,用户可利用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于进行跨国家比较或构建面板数据模型。该数据集适用于表格分类、回归分析及时间序列预测等机器学习任务。
背景与挑战
背景概述
童工现象,尤其是儿童从事有害工作的严峻现实,已成为全球发展议程,特别是联合国可持续发展目标8.7所聚焦的核心议题。在此背景下,国际劳工组织(ILO)通过其ILOSTAT数据库,为政策制定与学术研究提供了权威的量化基础。该数据集由Electric Sheep Asia于2025年重新整理并发布,聚焦于1996年至2025年间亚洲31个国家的儿童有害工作比例,并按性别、年龄及就学状况进行精细分层。其核心研究问题在于系统揭示亚洲地区儿童遭受劳动剥削的时空分布特征与结构性差异。依托ILO长期积累的标准化调查统计方法,该数据集不仅为比较劳动经济学、发展社会学提供了不可或缺的纵向面板数据,更以细粒度的分类指标,显著推动了区域内儿童保护政策的效果评估与国际对标研究。
当前挑战
该数据集所应对的首要领域挑战在于,量化儿童在有害劳动中的暴露程度本身极为复杂,涉及脆弱定义、隐蔽劳动形式以及不同国家统计口径的差异,传统数据往往难以全面捕捉动态变化。在构建过程中,ILO面临的核心挑战是整合来自31个国家、时间跨度达30年的多源调查微观数据,需依据国际劳工统计学家会议(ICLS)标准进行繁杂的概念统一与变量归化,以克服数据不兼容与质量参差不齐的问题。此外,由于部分国家的数据存在方法变更或可靠性存疑(如标注为'provisional'或'unreliable'的状态),在保留原始足迹的同时确保时间序列的可比性,对数据清洗与标注提出了极高要求。最后,将多维度分层(性别、年龄、入学状态)的庞杂指标以标准化范式高效、无偏地封装为机器学习就绪格式,亦是一重不容忽视的技术挑战。
常用场景
经典使用场景
该数据集记录了亚洲31个国家1996至2025年间儿童从事危险工作的比例,按性别、年龄及就学状况进行细致分层。其最经典的使用场景是作为时间序列与面板数据的分析基础,研究者可借此追踪特定国家或区域儿童劳动风险的历史演变轨迹。通过将观测值按年份与国家交叉排列,能够揭示危险工作比例在时间维度上的波动规律,为评估劳动政策干预效果提供量化依据。同时,性别与年龄维度的细分允许开展差异分析,识别哪些群体面临更高风险,从而精准定位脆弱人群。数据集简洁的结构使其极易融入回归分析、聚类分析或机器学习预测模型,是劳动经济学与发展研究中不可或缺的基础数据资源。
衍生相关工作
基于该数据集,学术界已衍生了多个方向的经典研究。在进行跨国比较分析时,研究者常将其与ILO发布的失业率、最低工资等宏观指标进行关联建模,探讨劳动力市场制度对家庭劳动供给决策的传导机制。同时,该数据与教育统计数据的整合催生了一系列关于“上学-工作”时间分配的经济计量模型,深化了对童工非线性转换的理解。在预测领域,学者利用时序神经网络等深度学习模型,对未来五年亚洲范围内的危险儿童劳动比例进行推估,助力预防性政策的预先布局。此外,该数据还被用于构建儿童劳动风险评估指数,并将其与减贫、气候变化等议题结合,产出了跨学科的前沿成果,推动了可持续社会发展研究的纵深发展。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区童工从事危险工作的比例,按性别、年龄和就学状况进行分层统计,为评估全球可持续发展目标(SDG)中关于消除童工现象的目标提供了关键数据支撑。当前前沿研究方向包括:利用时间序列分析与机器学习模型,预测亚洲各国危险童工比例的演变趋势,并探究贫困、教育缺失、冲突等社会经济变量与童工风险之间的因果关联。该数据集在2025年前后联合国加速推动“消除童工国际年”行动中成为重要实证工具,助力政策制定者识别高风险群体并设计精准干预措施,其跨年度、多国别的结构化数据为比较研究奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务