遇见数据集

electricsheepeurope/europe-ilo-cld-xsna-sex-age-nb-children-in-employment-by-sex-and-age-thousands

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲22个国家的童工数据,涵盖1995年至2025年,共有759个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家。核心指标为按性别和年龄划分的就业儿童数量(单位:千)(CLD_XSNA_SEX_AGE_NB),数据按性别(总计、男性、女性)和年龄等维度进行细分。数据集以表格形式组织,包含国家代码、年份、观测值、数据来源、质量标志等列,适用于表格分类、回归和时间序列预测等任务。数据由Electric Sheep Europe重新打包,以Parquet格式发布,便于机器学习使用。

This dataset contains child labour data for 22 European countries, spanning from 1995 to 2025, with 759 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to European countries. The core indicator is Children in employment by sex and age (thousands) (CLD_XSNA_SEX_AGE_NB), disaggregated by sex (total, male, female) and age dimensions. The dataset is organized in tabular format, including columns such as country code, year, observed value, data source, and quality flags, suitable for tasks like tabular classification, regression, and time-series forecasting. It is repackaged by Electric Sheep Europe in Parquet format for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-cld-xsna-sex-age-nb-children-in-employment-by-sex-and-age-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,聚焦于欧洲地区儿童就业情况。数据集通过ILOSTAT的REST API直接抽取指标代码为CLD_XSNA_SEX_AGE_NB的观测数据,并依据欧洲ISO3国家代码进行地理筛选。ILOSTAT依据国际劳动统计学家会议(ICLS)的定义对原始调查微观数据进行统一协调,数据来源在source.label列中予以标注,确保了数据的可追溯性与跨国家可比性。
特点
数据集包含来自22个欧洲国家的759条观测记录,时间跨度从1995年至2025年,覆盖了儿童就业人数这一关键指标。数据按性别(总计、男性、女性)和年龄组进行细致分层,提供了丰富的维度用于深入分析。观测值以千人为单位,同时附有观测状态、数据来源、指标注释等多重元数据,有助于用户评估数据质量并识别潜在的方法学中断或统计口径变化。
使用方法
用户可通过HuggingFace的datasets库快速加载该数据集,使用load_dataset函数即可将其转换为pandas DataFrame进行后续操作。支持按国家代码筛选特定国家的数据,也可针对单一指标按时间序列进行排序与可视化。此外,用户能够通过数据透视表将长格式数据重塑为国家×年份的矩阵形式,便于面板数据分析与建模。数据集以Parquet格式存储,并遵循CC-BY-4.0许可协议,适合学术研究与政策分析场景。
背景与挑战
背景概述
童工问题作为全球劳动市场中的一项严峻挑战,直接影响着儿童的健康成长与社会公平。国际劳工组织(ILO)统计部门作为劳动统计领域的权威机构,其下设的ILOSTAT数据库长期致力于汇集各国劳动力调查、家庭收入调查及行政记录等多源数据,为童工监测提供可靠依据。本数据集由Electric Sheep Europe于2025年基于ILOSTAT API重新整理,聚焦欧洲22国在1995至2025年间按性别与年龄划分的童工就业人数(单位:千人),共包含759条观测记录。该数据集旨在为研究者、政策制定者及国际组织提供标准化、机器可读的时序数据,以支持跨区域童工趋势分析、政策效能评估及可持续发展目标(SDG)相关指标的追踪,有力推动了劳动经济学与儿童保护领域的实证研究。
当前挑战
本数据集所面临的首要挑战在于解决童工统计中的多源异构性与定义一致性难题——各国采用不同的劳动力调查工具与年龄分组标准,ILO需依赖国际劳工统计学家会议(ICLS)的定义进行繁复的数据协调,但标志性注释如“方法论修订”仍揭示了时序断裂风险。构建过程中,数据集需处理缺失的性别与年龄分类维度、年度频率下部分国家观测稀疏(如波兰仅2021—2025年15条记录),以及依赖ILO“最佳来源”选择机制可能引入的样本偏差。此外,多国数据标注为“不可靠”状态,表明调查覆盖率或报告质量参差不齐,导致模型在时空推断时面临噪声与异方差的严峻考验。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集被广泛用于分析欧洲各国儿童就业的时空分布特征与演变趋势。研究者可借助其包含的22个国家、跨越三十余年的面板数据,构建固定效应或随机效应模型,探究性别、年龄层等维度下儿童就业率的异质性。典型场景包括评估经济周期对童工现象的影响、比较不同社会保护制度下儿童劳动参与率的差异,以及检验国际劳工组织核心公约在各国的落实情况。
衍生相关工作
围绕此数据集已衍生出一系列标志性工作,包括国际劳工组织年度《全球童工报告》中欧洲章节的统计测算,以及多项基于多重对应分析和分层回归模型的跨国比较研究。在计量方法上,学者们开发了融合季节性调整与断点检测的时间序列预测框架,以捕捉政策干预前后的结构突变。此外,以该数据为训练集,产生了若干面向劳动统计的时序预测模型及分类算法,进一步拓展了官方统计数据在机器学习领域的应用边界。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲22国1995至2025年间童工就业的性别与年龄分布量化分析,在国际劳工组织(ILO)ILOSTAT统计框架下,为揭示欧洲区域童工现象的时空演变规律提供了标准化、机器可读的观测基准。当前前沿研究正围绕三重维度展开:其一,结合联合国可持续发展目标(SDG)8.7中消除童工的目标,利用该长时序面板数据构建预测模型,识别政策干预效果与就业浪潮的关联节点;其二,通过性别(SEX_T/M/F)与年龄段(如15–17岁)的细粒度拆解,剖析隐形童工(如家庭帮佣、非正规经济从业)的结构性特征,挑战传统劳动力调查的低估偏差;其三,与ILO同期发布的工资、社会保障等指标交叉关联,推演低技能劳动需求扩张对学龄儿童劳动参与率的溢出效应,尤其在东南欧与后苏联国家经济转型背景下。该数据集因与欧盟《童工与劳动监测体系》及欧洲复兴开发银行社会合规审计等热点事件深度绑定,成为评估全球供应链中“零童工”承诺实际落地差距的关键实证工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务