遇见数据集

electricsheepasia/asia-ilo-cld-xsna-sex-age-stu-rt-share-of-children-engaged-in-economic-activity-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲32个国家从1996年至2025年的2,075个观测值,专注于童工主题,具体指标为按性别、年龄和上学情况划分的儿童参与经济活动比例(%)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API提取并过滤为亚洲国家代码。数据集以表格形式呈现,包含国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、年龄分类、上学情况分类、观测年份、观测值、观测状态等列。数据按性别(总计、男性、女性)等维度进行分解,并包含数据质量注释,例如年度频率、ILO选择的最佳来源以及分解列的非空条件。数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为研究人员和开发者提供机器学习就绪的亚洲童工统计数据。

This dataset contains 2,075 observations across 32 Asia countries spanning 1996–2025, focusing on the child labour topic with the specific indicator Share of children engaged in economic activity by sex, age and school attendance (%). The data is sourced from the International Labour Organization (ILO)s ILOSTAT statistics database, extracted via the REST API and filtered to Asia ISO3 country codes. The dataset is presented in tabular format, including columns such as country code, country name, data source, indicator code, indicator name, sex classification, age classification, school attendance classification, observation year, observed value, and observation status. Data is disaggregated by dimensions like sex (total, male, female) and includes data quality caveats, such as annual frequency, ILO-selected best source, and non-null conditions for disaggregation columns. The dataset is suitable for tasks like tabular classification, tabular regression, and time-series forecasting, aiming to provide machine learning-ready statistical data on child labour in Asia for researchers and developers.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xsna-sex-age-stu-rt-share-of-children-engaged-in-economic-activity-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦亚洲地区儿童经济参与状况。构建过程通过直接调用ILOSTAT提供的REST API,提取指标CLD_XSNA_SEX_AGE_STU_RT(按性别、年龄和就学情况划分的儿童经济参与率)的原始调查微观数据,并依据国际劳工统计学家会议(ICLS)定义进行统一整合与标准化处理。随后,数据被精确过滤至亚洲32个国家的ISO3国家代码范围,确保地理聚焦的纯粹性。为保障数据溯源与质量,每个观测值均保留了源标签(source.label)字段,记录数据来源的具体调查类型,最终形成包含2,075条观测值、跨1996年至2025年时间跨度的结构化面板数据。
特点
此数据集的核心特色在于其严谨的统计粒度与多层次分类维度。数据不仅按儿童性别(男、女、合计)进行细分,还通过classif1和classif2字段囊括了年龄范围(如5-17岁)与就学状态(是否在校)等关键社会人口学分组,提供了深入剖析儿童劳动现象的微观视角。此外,数据集收录了来自32个亚洲国家的长期时间序列观测,覆盖近三十年跨度,为分析区域趋势与跨国比较奠定了坚实基础。值得强调的是,所有数据均依据ILO筛选的“最佳来源”进行呈现,并标记了观测值的可靠性状态(如“不可靠”)与方法论变更注释,确保研究者在使用时能够充分知悉数据质量与潜在局限。
使用方法
使用者可通过HuggingFace数据集库的load_dataset函数便捷加载该数据集,并立即转换为Pandas DataFrame进行高阶分析。例如,可直接以国家代码(ref_area)过滤某一特定国家的观测,或针对指标CLD_XSNA_SEX_AGE_STU_RT按时间序列排序并可视化其演变趋势。对于需要构建跨国比较的研究,可通过pivot_table函数将数据重塑为国家×年份的矩阵形式,便于进行面板数据建模或统计推断。此外,数据集还预留了观测状态标志字段(obs_status),使研究者能够根据数据可靠性进行子集筛选,从而在分析中控制质量偏差,确保结论的稳健性。
背景与挑战
背景概述
童工问题一直是国际社会关注的焦点,尤其在亚洲地区,因经济发展不均、教育普及程度差异及社会文化因素,童工现象依然严峻。国际劳工组织(ILO)作为全球劳动领域权威机构,其下属统计数据库ILOSTAT系统性地收集并整合了全球200多个经济体的劳动力数据。在此背景下,Electric Sheep Asia团队于2025年基于ILOSTAT的API接口,重新打包并发布了覆盖32个亚洲国家、跨越1996年至2025年、共计2075个观测值的童工经济参与率数据集。该数据集聚焦于按性别、年龄及入学状况分层的儿童经济活动参与比例,旨在为区域发展研究、政策评估及可持续发展目标(SDG)监测提供标准化、机器可读的量化工具,对推动亚洲地区童工问题的实证研究具有重要基础性支撑作用。
当前挑战
该数据集所应对的核心挑战涉及童工问题的复杂性:首先,不同国家对童工的定义与衡量标准存在差异,ILO虽采用国际劳工统计学家会议(ICLS)标准进行统一化,但各国原始调查数据在收集方法、问卷设计与执行质量上参差不齐,例如部分国家的观测值被标记为“不可靠”,这制约了跨国比较的精确性。其次,在数据构建过程中,面临多来源数据整合的挑战,如同一国家同一时期可能存在多个调查来源,需依赖ILO的“最佳来源”筛选规则,但该规则并非完全透明;此外,数据的时间分布不均,如伊朗贡献了270条记录而部分国家仅数十条,加之少数年份数据缺失,导致时间序列分析时可能存在偏差。同时,分类维度复杂(性别、年龄组、教育状况多重组合),增加了数据清洗与模型兼容的难度。
常用场景
经典使用场景
该数据集记录了1996年至2025年间亚洲32个国家中儿童参与经济活动的比例,并按性别、年龄及在校状态进行细致分层,共计2075条观测。经典使用场景聚焦于构建多元分类与回归模型,以揭示不同亚群中童工现象的分布规律与影响因素。例如,研究者可依据性别与年龄组别划分,训练模型预测特定年份或国家的童工比率;亦可融入时间维度,结合时序分析方法探究童工变迁趋势。该数据还适合作为基准测试集,用于评估不同统计模型在稀疏样本与多层次分类变量下的泛化性能,为亚太区域劳动经济学研究提供了标准化的分析入口。
实际应用
在实际应用层面,该数据集为国际组织、非政府机构及政府部门开展童工监测与干预提供了精准的数据基础。例如,联合国儿童基金会可借助该数据评估各国在降低童工比例方面的进展,并动态调整援助优先级。亚洲各国劳动与社会保障部门可依据性别与年龄分组数据,识别童工高发地区与脆弱群体,从而定向投放教育补贴与职业培训资源。此外,该数据还适用于构建预警系统,通过时序建模预判未来童工波动趋势,辅助政策制定者提前部署干预措施,实现从被动应对向主动预防的治理转型。
衍生相关工作
基于该数据集的衍生研究涵盖了多篇聚焦亚太区童工决定因素的计量经济学论文,其中经典工作包括利用双重差分法评估义务教育政策对童工比例的因果影响,以及借助随机森林与梯度提升模型识别驱动童工的最显著社会经济变量。在机器学习领域,研究者常以该数据为测试床,开发处理类别不均衡与小样本问题的分层采样算法。此外,时序预测方向的代表作尝试引入Prophet与LSTM模型,对部分国家童工率进行滚动预测,其成果被后续跨区域比较研究所引用。这些衍生产出不仅深化了对亚洲童工机制的理解,也推动了因果推断与预测方法论在劳动经济学的创新融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务