遇见数据集

electricsheepasia/asia-ilo-cld-xchl-sex-age-nb-children-in-child-labour-by-sex-and-age-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲33个国家从1996年至2025年的童工数据,共648个观测值,聚焦于一个核心指标:CLD_XCHL_SEX_AGE_NB,即按性别和年龄划分的童工儿童数量(以千为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理,覆盖了包括伊朗、印度、巴基斯坦等国家。数据集提供了详细的列结构,如国家代码、年份、观测值、数据来源和质量标志,并支持按性别(总计、男性、女性)和年龄等维度进行细分。数据以表格形式组织,适用于分类、回归和时间序列预测等机器学习任务。

This dataset contains 648 observations of child labour data across 33 Asia countries, spanning from 1996 to 2025, with a focus on one distinct indicator: CLD_XCHL_SEX_AGE_NB — Children in child labour by sex and age (thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered for Asian countries, covering nations such as Iran, India, and Pakistan. It includes detailed columns like country codes, year, observed values, data sources, and quality flags, with disaggregation dimensions for sex (total, male, female) and age. The dataset is structured in tabular format and is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xchl-sex-age-nb-children-in-child-labour-by-sex-and-age-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接提取指标代码为CLD_XCHL_SEX_AGE_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围过滤。数据经过ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理,整合自各国劳动力调查、家计调查及行政记录等多源微观数据。最终由Electric Sheep Asia团队封装为Parquet格式,确保数据在HuggingFace平台上的机器学习就绪性。
特点
数据集包含648条观测记录,覆盖33个亚洲国家,时间跨度从1996年至2025年,聚焦于按性别与年龄分层的童工数量(单位:千人)。核心指标唯一,但提供了丰富的细分维度,包括性别(总计、男性、女性)和年龄组别,数据来源在source.label列中明确标注以保证可追溯性。还附带了观测状态标志和系列中断等注释信息,便于研究人员评估数据质量与可靠性。
使用方法
用户可通过HuggingFace的datasets库一键加载数据集,使用load_dataset函数直接获取训练集并转换为Pandas DataFrame进行分析。典型操作包括按国家编码过滤特定国家的子集、按时间排序绘制单指标时间序列图,或利用数据透视表构建国家×年份的观测值矩阵。数据集遵循CC-BY-4.0许可协议,使用时需同时引用ILO原始数据源及Electric Sheep Asia的再封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,并由Electric Sheep Asia重新打包整理,聚焦于亚洲33个国家1996至2025年间童工现象的性别与年龄分布,包含648条观测记录。童工作为全球劳动市场中的严峻议题,直接关联到联合国可持续发展目标中关于消除一切形式童工的具体要求,而亚洲正是童工问题突出的区域之一。该数据集的创建旨在为研究者、政策制定者及国际组织提供标准化、可比较的统计依据,以支持针对童工现象的跨国家、跨时间序列分析,推动了区域劳动经济学与社会政策领域的数据驱动研究,成为评估亚洲童工治理成效的重要参考资源。
当前挑战
童工数据的收集与整合面临多重挑战。首先,各国数据收集方法存在差异,部分国家依赖劳动力调查,另一些则使用家计调查或行政记录,导致数据口径与测算标准不一,对跨区域比较构成障碍。其次,童工现象具有隐蔽性,受访者可能因社会压力或法律风险隐瞒真实情况,造成官方统计偏低。此外,数据集虽标注了最佳来源与数据状态标志(如不可靠、方法修订),但部分年份观测值缺失或不连续,尤其是早期年份覆盖不足,增加了时间序列建模的复杂度。最后,数据结构中包含的元信息(如来源代码与分类标签)虽提升了可追溯性,但对非专业用户而言解析门槛较高,可能影响数据在实际政策评估中的直接应用。
常用场景
经典使用场景
该数据集涵盖了1996年至2025年间亚洲33个国家的童工数量观测值,按性别和年龄维度进行细分,是研究亚洲区域童工现象的权威数据来源。经典的使用场景包括利用时间序列模型预测不同国家童工人数的变化趋势,或通过分类与回归方法分析童工现象的性别与年龄分布特征。数据来自ILOSTAT官方统计,遵循国际劳工统计学家会议定义,确保了跨国的可比性与统计口径的一致性,为区域比较研究提供了坚实的数据基础。
衍生相关工作
该数据集衍生了多项经典工作,包括基于ILOSTAT数据构建的全球童工预测模型、用于评估区域童工减少因素的面板数据分析研究,以及结合地理与经济指标的童工风险地图绘制。研究团队常将该数据与教育统计、贫困指数等外部数据集融合,深入探讨童工现象背后的多维度成因。数据集的标准化格式与便捷的Python加载接口,降低了研究门槛,推动了开源社区中关于童工问题的复现研究与跨学科合作,形成了丰富的学术延伸生态。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区童工现象的性别与年龄维度解构,为国际劳工组织(ILO)推动的SDG体面劳动目标提供了关键的量化支撑。近年来,随着全球供应链透明度立法(如欧盟《禁止强迫劳动产品条例》)的推进,研究重心已从单纯的童工发生率统计转向多维交叉分析,尤其是通过性别(SEX_T/M/F)与年龄分层(5-17岁)揭示童工在家庭经济、教育剥夺与健康风险中的脆弱性分布。数据集横跨1996至2025年、涵盖33个亚洲国家的时序记录,使其能够服务于政策干预效果评估——例如印度与巴基斯坦的数据密集度(56与54行)为评估南亚次大陆的扶贫与义务教育改革对童工率的影响提供了实证基础。此外,ILOSTAT对调查源标注(如MICS、LFS)与序列断裂标记(break in series)的规范,有助于研究者控制方法论异质性,从而在时间序列预测与因果推断中提升结论的稳健性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务