遇见数据集

electricsheepasia/asia-ilo-cld-xhaz-sex-age-nb-children-in-hazardous-work-by-sex-and-age-thousand

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的童工统计数据,专门关注亚洲地区。数据集提供了按性别和年龄划分的从事危险工作的儿童数量(以千为单位),涵盖32个亚洲国家,时间跨度为1996年至2025年,共包含565个观测值。核心指标为CLD_XHAZ_SEX_AGE_NB,数据通过ILOSTAT REST API获取,并经过和谐化处理以确保一致性。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、年龄分类、观测年份、观测值及其状态标志等列,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并标注了数据质量注意事项,如来源选择和分解列的非空限制。

This dataset contains child labour statistics from the International Labour Organization (ILO) ILOSTAT database, focusing on Asia. It provides data on the number of children in hazardous work by sex and age (in thousands), covering 32 Asian countries from 1996 to 2025, with 565 observations. The core indicator is CLD_XHAZ_SEX_AGE_NB. Data is sourced directly from the ILOSTAT REST API and harmonized using ICLS definitions. The dataset includes columns such as country code, country name, data source, indicator code, sex disaggregation (total, male, female), age classification, observation year, observed value, and status flags. It is suitable for tabular classification, regression, and time-series forecasting tasks. Data is published at annual frequency, with caveats on source selection and non-null disaggregation columns.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xhaz-sex-age-nb-children-in-hazardous-work-by-sex-and-age-thousand 数据集图片
构建方式
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT构建,通过其REST API直接提取指标CLD_XHAZ_SEX_AGE_NB的原始数据。数据来源涵盖各国劳动力调查、家庭收入调查、企业调查及行政记录,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。随后,经Electric Sheep Asia过滤至亚洲地区的32个ISO3国家代码,整合为包含565条观测值、覆盖1996年至2025年时间跨度的结构化表格。每条记录均保留源数据标签(source.label)以确保可追溯性,并包含性别与年龄等分类维度。
特点
该数据集聚焦于亚洲地区儿童从事有害工作的规模(以千人为单位),具有高度专业化和地域针对性的特点。其核心优势在于数据来源权威,由ILO官方统计部门统一协调,并标注了观测状态(如临时值或不可靠值)与方法论变更注释,便于用户评估质量。此外,数据集提供了按性别(总、男、女)和年龄段的细粒度分解,支持多维分析。32个亚洲国家的覆盖范围以及近30年的时间跨度,使其成为研究区域儿童劳动问题长周期趋势的宝贵资源。
使用方法
用户可通过HuggingFace的datasets库轻松加载该数据集,使用load_dataset()函数即可获取名为train的表格数据,并直接转换为pandas DataFrame进行后续操作。典型应用包括按国家代码(ref_area)筛选特定国家数据、按指标(indicator)排序以绘制时间序列图,或通过透视表(pivot_table)将数据重塑为国家×年份的矩阵形式,便于进行对比分析或作为时间序列预测模型的输入。数据集的列结构清晰,包含观测值、分类标签及注释字段,适合用于分类、回归或时间序列预测等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)于2025年整理发布,并由Electric Sheep Asia在HuggingFace平台进行重新封装,聚焦于亚洲32个国家1996至2025年间儿童从事有害工作的性别与年龄分布数据(单位:千人)。作为全球劳动力统计的权威来源,ILOSTAT通过整合各国劳动力调查、家庭收入调查及行政记录,依据国际劳工统计学家会议(ICLS)定义进行数据协调,为研究童工问题提供了标准化的跨区域、跨时间序列指标。该数据集共包含565条观测记录,涵盖单一核心指标“按性别和年龄划分的从事有害工作的儿童数”,其发布为亚洲地区童工现象的量化分析、政策评估及可持续发展目标(SDG)中体面工作的监测提供了关键基础数据,尤其在性别与年龄维度上的细粒度分层,使得研究者能够深入揭示不同群体在有害工作中的暴露程度与变化趋势。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:亚洲作为童工现象高发区域,各国在经济发展水平、劳动法规执行力度及调查能力上存在显著差异,导致跨国比较时面临数据可比性与一致性难题,例如部分国家使用不同年份的抽样框架或调查问卷,且数据质量标识如“不可靠”或“方法修订”揭示了统计口径变动带来的时序断裂问题。在数据集构建过程中,主要挑战包括多源数据的高效整合与清洗,ILOSTAT需从超过200个经济体的异构数据源中提取信息,并通过最佳源选择算法避免同一国家与年份的多源冲突;此外,数据隐含的缺失模式(如部分国家仅覆盖少数年份、特定性别的数据稀疏)以及分类维度(如年龄分组定义差异)的标准化,均对构建统一数据集的完整性与可追溯性提出了严苛要求。
常用场景
经典使用场景
该数据集记录了1996至2025年间亚洲32个国家的童工从事危险工作的数量,按性别与年龄分层,共计565条观测。其经典使用场景集中在劳动经济学与儿童保护研究领域,学者可借此量化分析区域童工暴露于高风险环境的规模与演变趋势。例如,通过时间序列建模可揭示特定国家如伊朗或巴基斯坦危险童工数量的波动规律,为国际劳工组织(ILO)的监测框架提供实证支撑。数据集的结构化设计使其能便捷地与其他社会经济指标融合,构建多维度回归模型,探究贫困、教育可及性等变量与危险童工现象之间的因果关联。
实际应用
在实际应用中,该数据集成为国际发展组织、政府劳动部门及非政府机构制定干预策略的重要工具。例如,政策制定者可依据数据识别亚洲各国危险童工的高发年龄段与性别差异,从而精准配置教育资源与社会保护项目。国际劳工组织可借助其时间序列特征追踪各国在消除童工方面的进展,为技术合作与资金分配提供优先级排序。此外,数据集的分层结构(如按性别与年龄细分)支持设计定制化干预方案,例如针对男性青少年在农业或建筑业的危险劳动风险开展专项职业安全培训。
衍生相关工作
该数据集的高质量结构化特征催生了多项衍生性研究范式。其一,它以标准化格式封装了ILOSTAT的官方指标,为构建亚洲童工预警系统提供了机器学习就绪的数据原料,研究者可据此开发基于时序特征的预测模型。其二,其跨国家跨年度的面板数据结构激励了比较政治经济学领域的复现性研究,尤其是关于童工立法效力与劳动力市场弹性的定量分析。其三,该数据集常被整合进更广泛的劳动统计语料库中,作为验证因果推断方法(如双重差分与工具变量法)的基准数据,推动了发展经济学方法论的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务