遇见数据集

electricsheepasia/asia-ilo-cld-xhaz-sex-age-stu-nb-children-in-hazardous-work-by-sex-age-and-school-a

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲31个国家从1996年至2025年的儿童从事危险工作的统计数据,具体按性别、年龄和上学出勤状况进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,包含1,659条观测记录,覆盖一个核心指标:CLD_XHAZ_SEX_AGE_STU_NB(按性别、年龄和上学出勤状况划分的从事危险工作的儿童,单位:千人)。数据集提供了详细的模式,包括国家代码、年份、观测值、数据来源、性别分类、年龄分类、上学出勤状况分类以及数据质量标志(如不可靠或临时数据)。数据通过ILOSTAT REST API获取,并经过处理以统一模式,适用于表格分类、回归和时间序列预测等任务。使用许可为cc-by-4.0,要求在使用时引用原始来源和重新包装方Electric Sheep Asia。

This dataset contains statistical data on children in hazardous work in Asia, disaggregated by sex, age, and school attendance status. It covers 31 Asian countries from 1996 to 2025, with 1,659 observations and one core indicator: CLD_XHAZ_SEX_AGE_STU_NB (Children in hazardous work by sex, age and school attendance status, in thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database and features a detailed schema including country codes, years, observed values, data sources, sex classification, age classification, school attendance classification, and data quality flags (e.g., unreliable or provisional data). The data is retrieved via the ILOSTAT REST API and processed into a unified schema, suitable for tasks such as tabular classification, regression, and time-series forecasting. It is released under the cc-by-4.0 license, requiring citation of both the original source and the repackaging by Electric Sheep Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xhaz-sex-age-stu-nb-children-in-hazardous-work-by-sex-age-and-school-a 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接提取指标CLD_XHAZ_SEX_AGE_STU_NB的原始数据,并依据亚洲国家ISO3代码进行地域筛选。ILO采用国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行标准化与整合,数据集中的source.label字段标识了每一条观测的原始数据来源,确保数据可追溯。最终由Electric Sheep Asia团队重新封装为HuggingFace数据集,共收录了31个亚洲国家从1996年至2025年的1,659条观测记录。
特点
该数据集聚焦于亚洲地区儿童从事有害劳动的状况,以千人为单位,提供了按性别、年龄及就学状态进行细分的指标观测值。其核心特点在于包含了sex、classif1、classif2等多维分类字段,支持对儿童劳动问题的精细化分析。此外,数据质量标注如obs_status字段标识了观测值的可靠性(如不可靠值),note_indicator字段则记录了序列中断或方法修订等元信息,为使用者评估数据可信度提供了重要参考。
使用方法
使用者可通过HuggingFace的datasets库以load_dataset()函数一键加载数据,并将其转换为Pandas DataFrame进行灵活操作。示例展示了按国家筛选(如印尼)、针对单一指标进行时间序列可视化,以及通过pivot_table构建国家×年份的观测值矩阵等典型分析流程。该数据集适用于儿童劳动问题的时间趋势分析、跨区域比较以及基于性別或年龄维度的子群体研究,为政策制定与学术研究提供了便捷的数据基础。
背景与挑战
背景概述
儿童参与危险劳动是全球劳动力市场与儿童保护领域共同关注的严峻议题。国际劳工组织(ILO)作为该领域的权威机构,依托其ILOSTAT数据库,长期系统性地追踪各国童工状况。该数据集由Electric Sheep Asia于2025年重新打包发布,聚焦亚洲地区,涵盖31个国家从1996年至2025年的1,659条观测记录,核心指标为按性别、年龄及就学状态分组的从事危险工作儿童数量(单位:千)。数据集整合了各国劳动力调查、家庭收入调查等多源微观数据,经ILO依据国际劳工统计学家会议(ICLS)定义进行协调统一,旨在为区域政策评估、学术研究及可持续发展目标(特别是SDG 8.7)的监测提供标准化、可复用的定量基础。其发布显著降低了在亚洲尺度下分析童工结构性特征的准入门槛,对理解经济发展、教育普及与劳动保护之间的复杂关联具有重要实证价值。
当前挑战
该数据集在解决与构建过程中面临多重挑战。在领域问题层面,核心挑战在于如何精准刻画亚洲区域儿童参与危险劳动的分布特征及其动态演变,尤其是在跨国比较中处理各国调查口径、法律定义与统计能力的异质性,这直接影响对童工现象成因与干预效果的因果推断。在构建过程中,挑战体现在三方面:一是源数据质量参差不齐,部分国家或年份的观测值被标记为不可靠(obs_status为'U'),且存在因方法论修订导致的序列断裂(break in series),这削弱了时间序列分析的连续性;二是数据时空覆盖极不均衡,例如伊朗(IRN)贡献了269条记录,而老挝(LAO)仅39条,稀疏性与缺失值问题显著,限制了多国面板模型的稳健估计;三是分类变量(性别、年龄组、就学状态)的交叉组合使得观测维度剧增,部分细粒度分组样本量过小,可能导致统计推断效力不足,需要研究者谨慎处理数据稀疏性与聚合层级的选择。
常用场景
经典使用场景
在劳动经济学与儿童保护研究领域,该数据集被广泛应用于分析亚洲地区儿童从事危险工作的时空分布规律。研究者可借此构建面板数据模型,探究性别、年龄及学校出勤状况与危险劳动参与率之间的内在关联。其跨越近三十年、覆盖三十一个国家的观测记录,为评估国际劳工组织第182号公约在亚洲的执行成效提供了量化依据,尤其适合用于跨国比较研究和政策干预效果的纵向追踪分析。
实际应用
在实际应用中,该数据集为亚洲各国劳动部门制定精准干预策略提供了决策支撑。政府机构可利用其细粒度分类特征,定位高危行业中的特定人群(如5-17岁失学女童),从而优化社会救助资源的投放。国际组织如联合国儿童基金会借助该数据评价援助项目的成效,而非政府组织则据此设计针对性的社区教育促进计划,将数据驱动的洞察转化为保护儿童权益的具体行动。
衍生相关工作
围绕该数据集已衍生出一系列经典研究范式。跨国不平等分解方法被用于比较南亚与东南亚的危重劳动分布差异;生存分析模型被创新性地应用于估算儿童从轻度劳动向危险劳动转化的风险概率;机器学习领域的梯度提升树被训练以预测高风险国家未来五年的危险劳动趋势。此外,该数据还催生了结合夜间灯光遥感数据的空间计量经济研究,探索区域经济发展与儿童劳动强度之间的地理关联规律。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务