遇见数据集

electricsheepasia/asia-ilo-cld-xsna-sex-age-geo-nb-children-in-employment-by-sex-age-and-rural-urban

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别、年龄和城乡地区划分的童工(千人)| 亚洲(ILOSTAT),是一个表格数据集,专注于童工统计。它包含1,653条观测数据,覆盖27个亚洲国家,时间跨度为1996年至2025年,核心指标为CLD_XSNA_SEX_AGE_GEO_NB,即按性别、年龄和城乡地区划分的童工人数(以千人为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至亚洲国家,采用CC-BY-4.0许可证发布。数据集包括多个维度列,如国家代码、性别(总、男性、女性)、年龄分类、地区类型(如国家层面)、观测年份和观测值等,并提供了数据质量说明(如年度频率、最佳源选择)和使用示例(如加载数据、筛选国家、时间序列分析)。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的机器学习就绪数据层。

This dataset is named Children in employment by sex, age and rural / urban areas (thousands) | Asia (ILOSTAT) and is a tabular dataset focused on child labour statistics. It contains 1,653 observations across 27 Asia countries, spanning the years 1996 to 2025, with a core indicator CLD_XSNA_SEX_AGE_GEO_NB, which represents children in employment disaggregated by sex, age, and rural/urban areas (in thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asia country codes, and released under the CC-BY-4.0 license. The dataset includes multiple dimension columns such as country code, sex (total, male, female), age classification, area type (e.g., national), observation year, and observed value, along with data quality notes (e.g., annual frequency, best source selection) and usage examples (e.g., loading data, filtering by country, time-series analysis). It is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-cld-xsna-sex-age-geo-nb-children-in-employment-by-sex-age-and-rural-urban 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,后者是全球劳动统计的权威来源。数据通过调用ILOSTAT的REST API接口直接获取,并依据亚洲ISO3国家代码进行地理范围过滤,最终整合了27个亚洲国家1996年至2025年间共1653条观测记录。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一标准化处理,并在source.label字段中标注数据来源以保障可追溯性。数据集以列式结构组织,包含国家代码、指标代码、时间、观测值及多个分类维度,便于直接加载与分析。
特点
该数据集聚焦于童工这一关键社会议题,涵盖27个亚洲经济体,时间跨度长达三十年。其核心指标为按性别、年龄及城乡分类的就业儿童人数(单位:千人),并支持通过性别(总计、男性、女性)、年龄组及地理覆盖类型等维度进行精细化的数据剖析。数据收录了来自不同调查来源的年度序列,并在obs_status及相关注释字段中提供了断点、方法论修订等质量标记,有助于用户评估数据的连续性与可靠性,支撑稳健的纵向比较研究。
使用方法
用户可通过HuggingFace Datasets库实现便捷加载,仅需一行代码`load_dataset()`即可将数据转换为Pandas DataFrame进行后续分析。数据集支持灵活操作,例如按ISO国家代码筛选特定国家的时间序列,或利用pivot_table功能将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析与可视化。每个观测记录均附带详尽的分类、来源及状态标记字段,用户可以依据sex、classif1和classif2等维度进行多层次的条件筛选与分组统计,深入探究童工现象的时空变迁模式。
背景与挑战
背景概述
童工与儿童就业问题在全球发展议程中占据重要位置,尤其在南亚和东南亚地区,贫困、教育缺失与社会保障不足交织,使得可靠、可比的统计数据成为政策制定的基石。在此背景下,国际劳工组织(ILO)统计司整合了各国劳动力调查与住户调查的微观数据,构建了ILOSTAT数据库,并据此推出了亚洲儿童就业数据集(asia-ilo-cld-xsna-sex-age-geo-nb-children-in-employment-by-sex-age-and-rural-urban)。该数据集由Electric Sheep Asia于2025年重新打包发布,覆盖了27个亚洲国家1996年至2025年的1,653条观测记录,聚焦于按性别、年龄及城乡地域划分的儿童就业人数(单位:千人)。通过严格的ILO数据协调流程与国际劳工统计学家会议(ICLS)定义,该数据集为理解亚洲区域儿童劳动参与模式提供了高颗粒度的面板数据,成为追踪可持续发展目标(SDGs)中体面工作指标的关键资源,推动了劳动经济学与公共政策领域的跨国实证研究。
当前挑战
数据集面临的挑战首先源于童工定义本身的复杂性与跨国可比性,不同国家对‘就业’和‘有害劳动’的界定存在差异,ILOSTAT虽借助ICLS标准进行协调,但原始来源的指标定义和调查方法变迁仍可能导致序列中断(如数据集中标注的‘Break in series’),影响时间序列分析的稳定性。其次,构建过程中面临数据稀疏性与覆盖不全的难题,部分年份和国家的观测值缺失,且由于数据来自多种调查类型(劳动力调查、多指标类集调查等),其频率、抽样框架与质量参差不齐,ILO虽选择‘最佳来源’但仍难以完全消除测量误差。此外,性别、年龄组与城乡分类的细分维度使得单元格估计数在某些组合下可能基于小样本,推断的稳定性与置信区间有待审慎评估,为后续的回归建模与趋势分解带来了方法层面的困难。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中关于亚洲27个国家、跨越1996年至2025年间童工就业状况的1653条观测记录,按性别、年龄以及城乡区域进行细致分层。研究人员常将其作为量化分析亚洲童工现象的基石,通过构建横截面回归模型或时间序列分解方法,探究童工发生率随经济发展、教育投入及城镇化进程变化的动态规律。数据集统一的ILO统计口径确保了跨国比较的可靠性与可复现性,使其成为评估亚洲各国在可持续发展目标8.7(消除童工)方面进展的权威标尺。
衍生相关工作
该数据集衍生了一系列具有影响力的经典工作。在方法论层面,有研究基于该数据训练了时序预测模型,用以预测特定区域童工人数的短期波动,从而辅助早期预警系统的构建。在实证研究方面,多篇发表于《世界发展》(World Development)与《劳动经济学》(Labour Economics)的论文利用此数据,量化了新冠疫情对亚洲童工回潮的冲击效应,揭示了学校关闭与家庭收入骤降如何共同加剧儿童就业压力。此外,该数据集还催生了多个开源分析工具包,简化了跨国劳动统计数据的可视化与报告生成流程。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区童工就业的时空演变与性别差异,近期研究前沿集中于利用时序建模与地理空间分析技术,揭示1996至2025年间27个亚洲国家童工人数的动态趋势及其与城镇化进程的关联。依托ILOSTAT权威统计框架,研究者可深入剖析城乡二元结构下童工分布的非均衡性,结合性别与年龄分层的细致维度,为国际劳工组织及各国政策制定者提供基于证据的干预靶点。此数据集的发布恰逢全球加速落实可持续发展目标8.7(消除童工)的关键节点,其高颗粒度属性有助于驱动因果推断与影响因素建模,对评估亚太地区童工治理成效、预警潜在热点区域具有不可替代的学术价值与实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务