遇见数据集

electricsheepasia/asia-ilo-cld-xhaz-sex-age-geo-rt-share-of-children-in-hazardous-work-by-sex-age-and

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲地区按性别、年龄和城乡区域划分的从事危险工作的儿童比例(%)数据,源自国际劳工组织(ILO)的ILOSTAT统计数据库。数据集涵盖26个亚洲国家,时间跨度为1996年至2025年,共1,305个观测值,核心指标为CLD_XHAZ_SEX_AGE_GEO_RT,表示从事危险工作的儿童比例。数据通过ILOSTAT REST API获取,并经过筛选和处理,以表格形式提供,包括国家代码、年份、观测值、性别分类、年龄分类、区域类型等字段。数据集适用于表格分类、回归和时间序列预测等任务,旨在支持童工相关的研究和政策分析。

This dataset contains data on the share of children in hazardous work by sex, age, and rural/urban areas (%) in Asia, sourced from the International Labour Organization (ILO) ILOSTAT statistical database. It covers 26 Asian countries from 1996 to 2025, with 1,305 observations, and focuses on the indicator CLD_XHAZ_SEX_AGE_GEO_RT. The data is retrieved via the ILOSTAT REST API, processed, and presented in tabular format, including fields such as country code, year, observed value, sex classification, age classification, and area type. It is suitable for tasks like tabular classification, regression, and time-series forecasting, supporting research and policy analysis on child labour.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xhaz-sex-age-geo-rt-share-of-children-in-hazardous-work-by-sex-age-and 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API接口直接获取指标代码为CLD_XHAZ_SEX_AGE_GEO_RT的原始数据,并依据ISO 3166-1 alpha-3标准筛选出26个亚洲国家的观测记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调处理,确保跨国可比性。数据集共包含1,305条观测值,时间跨度覆盖1996年至2025年,由Electric Sheep Asia团队重新封装为HuggingFace格式,以便于机器学习场景下的直接调用。
使用方法
用户可通过HuggingFace的datasets库以load_dataset()函数一键加载数据,并转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定国家的子集,或针对单一指标按时间排序绘制趋势图。亦可利用pivot_table函数构建国家×年份的矩阵,便于比较不同国家在相同时间窗口内的变化模式。数据以Parquet格式存储,支持高效的列式读取。使用时需遵循CC-BY-4.0许可协议,并同时引用ILO原始数据来源及Electric Sheep Asia的重新封装版本。
背景与挑战
背景概述
童工劳动是全球发展议程中的一项严峻挑战,尤其在亚太地区,数以百万计的儿童被迫从事危害其身心发展的劳动。国际劳工组织(ILO)长期致力于监测和消除童工现象,其下属的ILOSTAT数据库作为全球劳动统计的权威来源,提供了标准化的跨国可比数据。在此背景下,Electric Sheep Asia于2025年重新打包发布了“asia-ilo-cld-xhaz-sex-age-geo-rt”数据集,聚焦亚洲26个国家1996年至2025年间儿童从事有害工作的比例,并按性别、年龄和城乡地域进行分层。该数据集整合了ILO基于各国劳动力调查和家庭调查的标准化指标,旨在为研究者、政策制定者和国际组织提供细颗粒度的证据基础,以评估政策干预成效并推动可持续发展目标中关于消除童工的具体议程。其影响力在于,通过开放获取的机器学习就绪格式,降低了数据使用门槛,促进了跨学科研究与合作。
当前挑战
该数据集所解决的核心领域问题在于,童工现象具有高度隐蔽性和地域异质性,而传统统计来源常因定义不统一、时间跨度短或地理覆盖有限而难以支撑可靠的比较分析和因果推断。构建过程中面临的挑战包括:第一,数据来源的多样性——原始数据来自各国不同调查类型(如劳动力调查、多指标类集调查),调查设计差异可能导致系统性偏差,需要通过ILO的统计协调流程来统一标准;第二,数据缺失与质量问题——部分年份或国家的观测值标记为“不可靠”或存在方法论中断,需谨慎处理以保持连续性和可比性;第三,细颗粒度划分带来的稀疏性问题——按性别、年龄和城乡区域分层后,某些子群的样本量极小,可能影响统计估计的稳健性;第四,时间序列的非平衡性——各国数据频次不均,从1996年到2025年跨度较大,早期数据点稀少,为建模带来挑战。
常用场景
经典使用场景
在劳动经济学与儿童保护研究领域,该数据集凭借其覆盖26个亚洲国家、跨越近三十年(1996—2025年)的观测值,成为量化分析亚洲地区儿童从事有害工作比例的核心资源。研究者可基于性别、年龄及城乡区域等维度进行精细的亚组分析,从而揭示不同社会人口学特征下儿童劳动暴露的差异模式。其经典的用途在于构建面板数据模型,以追踪各国在该指标上的长期演变趋势,或是结合宏观经济变量与政策干预时间点,评估反童工立法、教育普及或社会保障体系对降低儿童有害劳动比例的实际效果。
解决学术问题
该数据集直击了发展经济学与社会政策研究中长期存在的关键难题——即缺乏系统、可比且时间跨度足够长的区域性童工风险数据。通过提供经过国际劳工组织(ILO)标准统一化处理的年度观测值,它使得跨国家、跨时期的比较分析成为可能,解决了以往因各国调查口径不一致或数据碎片化而无法开展严谨计量回归的困境。其学术意义在于为验证童工现象的经济决定因素理论(如家庭收入冲击与信贷约束的推拉作用)、评估国际劳工标准在各国的实施效力,以及量化有害劳动对儿童长期人力资本积累的负面影响,提供了可靠的数据基石。
实际应用
在实际决策层面,该数据集直接服务于亚洲各国劳动部门与国际发展机构(如联合国儿童基金会、世界银行)的政策制定与项目监测工作。应用者可以快速定位特定国家或地区在特定年份的童工风险水平,识别出高危子群体(如农村地区的低龄女童),据此精准调配社会干预资源。在可持续发展目标(SDG)8.7——即到2025年消除一切形式的童工劳动——的监测框架下,该数据作为核心指标源,被用于生成区域进度报告,帮助政府间组织评估各国是否走在如期达标的正轨上,并动态调整反童工行动计划。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区儿童从事危险工作的性别、年龄及城乡分布比例,为国际劳工组织(ILO)统计数据库的官方数据,经Electric Sheep Asia重新打包后,与机器学习工作流无缝衔接。当前前沿研究方向主要围绕利用该时间序列数据进行区域儿童劳动风险的时空建模,结合性别与地域维度,揭示亚洲26个国家在1996年至2025年间危险童工现象的演变规律。该数据与联合国可持续发展目标(SDGs)中关于消除童工的具体指标紧密相关,尤其在ILO推动的“2025年消除最恶劣形式童工”全球倡议背景下,为政策评估、干预优先级排序及跨国家比较分析提供了关键量化支撑。数据标准化处理与公开可复现性,显著降低了社会学与劳动经济学领域研究者开展系统综述与因果推断的门槛。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务