遇见数据集

electricsheepasia/asia-ilo-cld-xhaz-sex-age-ste-nb-children-in-hazardous-work-by-sex-age-and-status-i

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于亚洲地区从事危险工作的儿童数量的数据集,数据以千计,并按性别、年龄和就业状况进行细分。数据集包含1,989个观测值,覆盖29个亚洲国家,时间跨度为1996年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计的主要来源,通过国家劳动力调查、家庭收入调查、机构调查和行政记录等收集数据。数据集经过处理和重新打包,以Parquet格式发布,适用于机器学习任务,如表格分类、回归和时间序列预测。数据集中包含一个核心指标:CLD_XHAZ_SEX_AGE_STE_NB,即按性别、年龄和就业状况分类的从事危险工作的儿童数量(千计)。数据列包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类(总计、男性、女性)、年龄分类、就业状况分类、观测年份、观测值、观测状态等。数据集遵循cc-by-4.0许可证,使用时需引用原始来源和重新打包者。

This dataset contains data on the number of children in hazardous work in Asia, measured in thousands, disaggregated by sex, age, and status in employment. It includes 1,989 observations across 29 Asian countries, spanning from 1996 to 2025. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, a leading global source for labour statistics, which compiles indicators from national labour force surveys, household income surveys, establishment surveys, and administrative records. The dataset has been processed and repackaged, published in Parquet format, and is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting. The dataset features one core indicator: CLD_XHAZ_SEX_AGE_STE_NB, which stands for Children in hazardous work by sex, age and status in employment (thousands). Columns include country code, country name, data source, indicator code, indicator name, sex disaggregation (total, male, female), age classification, status in employment classification, observation year, observed value, observation status, and more. The dataset is released under the cc-by-4.0 license, and users are required to cite both the original source and the repackager when using it.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xhaz-sex-age-ste-nb-children-in-hazardous-work-by-sex-age-and-status-i 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于亚洲地区29个国家中从事危险工作的儿童数量,按性别、年龄及就业状态进行细致分层。数据通过ILOSTAT官方REST API直接抓取,并依据亚洲ISO3国家代码进行筛选过滤,确保了区域覆盖的精准性。ILO统计部门统一采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调处理,数据来源均在`source.label`列中标注,保障了数据的可追溯性与方法论的一致性。最终形成的观测记录共计1,989条,时间跨度从1996年至2025年,经Electric Sheep Asia整理并重新打包为HuggingFace标准数据集格式。
特点
该数据集以结构化表格形式呈现,包含29个亚洲国家长达近三十年的儿童危险工作统计时间序列数据,单一核心指标`CLD_XHAZ_SEX_AGE_STE_NB`可进行深入的交叉维度分析。其显著特色在于精细的分解维度——通过`sex`、`classif1`(如年龄分组)和`classif2`(如就业身份)等多列字段,实现了对观测值的多角度切分。此外,数据集标注了观测状态(如“不可靠”)和方法论修订说明(如序列中断),便于用户识别及处理数据质量异常。整体数据量级为1K-10K,兼具区域广泛性与指标聚焦度,适合进行劳动经济学与国际发展研究。
使用方法
研究人员可通过HuggingFace的`datasets`库便捷加载该数据集,使用`load_dataset`函数即可一键获取训练集并转换为Pandas DataFrame进行后续分析。典型应用场景包括筛选单一国家的时间序列数据以观察其国内儿童危险工作趋势,或针对核心指标按年份和国别构建国家×年份的透视矩阵,便于进行跨区域比较。数据集已预处理好为Parquet格式,极大简化了数据预处理工作。用户在使用时需遵循CC-BY-4.0许可协议,并建议在研究成果中同时引用ILO原始数据源及Electric Sheep Asia的重打包版本,以尊重数据贡献与二次加工的工作。
背景与挑战
背景概述
童工现象是全球可持续发展面临的严峻挑战,尤其是在亚洲地区,涉及数以百万计儿童的身心健康与未来发展。国际劳工组织(ILO)作为劳动统计领域的权威机构,其ILOSTAT数据库系统性地收集并整合了各国劳动力调查、家庭收支调查及行政记录等多源数据。在此背景下,Electric Sheep Asia于2025年对ILO的童工数据进行了重新封装,创建了asia-ilo-cld-xhaz-sex-age-ste-nb-children-in-hazardous-work-by-sex-age-and-status-i数据集。该数据集聚焦于亚洲29个国家1996年至2025年间从事有害劳动的儿童数量,按性别、年龄及就业状况进行分层统计,共计1989条观测记录。通过提供标准化且易于调用的结构化数据,该数据集为研究亚洲童工问题的规模、演变趋势及区域差异提供了可靠基础,有力支撑了可持续发展目标(SDG)中关于消除童工议题的量化分析与政策评估。
当前挑战
该数据集所应对的核心领域挑战在于,亚洲地区有害童工现象的测量与监测。由于各国统计能力、调查方法与定义标准存在显著差异,ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始微观数据进行统一协调,但数据源信息仍通过'source.label'字段保留以维持可追溯性。在构建过程中,数据集面临三重挑战:其一,跨国家、跨时间序列的数据异质性,例如部分观测值被标记为不可靠('U')或存在方法修订导致的数据断裂('Break in series'),需依赖ILO选定的'最佳来源'进行插补与筛选;其二,多级分类体系的融合难题,数据集包含性别(sex)、年龄(classif1)及就业状况(classif2)等多维度分层变量,但分类字段仅在指标发布相应细分时才非空,导致数据稀疏性显著;其三,数据覆盖的局限性,部分国家(如也门、阿富汗)仅有个别年份的观测记录,纵贯时间序列的完整性与可比性受到制约,从而影响区域趋势分析与建模的稳健性。
常用场景
经典使用场景
该数据集汇集了亚洲29个国家1996至2025年间从事危险工作儿童的数量统计,按性别、年龄及就业状态进行了精细分层。经典使用场景涵盖时间序列分析与面板数据建模,研究者可借此追踪不同国家危险童工现象的演变轨迹,或构建跨区域的纵向比较研究。数据以年为单位记录,支持基于时间变量的回归分析、趋势预测与异常值检测,尤其适合评估经济增长、政策干预与教育普及对童工现象的滞后效应。
衍生相关工作
该数据集衍生出一系列重要的学术工作,包括基于固定效应模型的多国面板回归研究,用以分离经济增长、教育投入与立法强度对危险童工的独立影响。机器学习的分类与回归任务也被引入,通过随机森林或梯度提升模型预测高风险群体特征。此外,融合地理空间信息与人口统计数据的空间计量分析,揭示了童工现象在国界周边的溢出效应。因果推断领域,研究者利用该数据构建双重差分模型,评估特定劳动禁令或现金转移支付项目的政策效果。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区童工在危险工作中暴露的性别、年龄及就业身份差异,为国际劳工组织(ILO)推动的《2030年可持续发展议程》中消除强迫劳动、终结现代奴隶制和贩卖人口的目标提供了关键数据支撑。前沿研究方向包括:结合时序分析与地理空间模型,揭示1996至2025年间亚洲29国危险童工分布的动态演变与区域异质性;利用机器学习算法识别高风险行业与脆弱群体,预测政策干预效果;以及整合性别与年龄交叉分类,评估童工现象的隐蔽性与代际传递风险。该数据集汇集了ILOSTAT标准化调查与行政记录,为全球反童工运动提供了可追溯的量化基准,尤其在疫情后经济复苏与供应链人权尽职调查中,成为监测企业社会责任与政府治理成效的重要工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务